Monitoring & Observability
จากศูนย์ ถึง ระดับ Production
เข้าใจตั้งแต่ ทำไมต้อง monitoring ไปจนถึงการวาง telemetry ครบ 3 เสาหลัก — Metrics, Logs, Traces — พร้อมแนวคิดที่ทีม SRE ใช้จริง เช่น Golden Signals, SLO/Error Budget, และ Lab ที่รันได้จริงด้วย Docker Compose
เส้นทางการเรียน
เรียนไล่จากบนลงล่าง แต่ละ module ต่อยอดจาก module ก่อนหน้า
0 · ปูพื้นฐาน
Monitoring คืออะไร ทำไมต้องมี และมองภาพรวมของทั้งวงการ
1 · แนวคิดหลัก
ภาษากลางของคนทำ Monitoring — ดูอะไร วัดอะไร ตั้ง alert ยังไง
Latency, Traffic, Errors, Saturation — 4 สัญญาณที่ Google ใช้เฝ้าทุกระบบ
สองสูตรลัดในการเลือก metric สำหรับ service (RED) และ resource (USE)
วัด 'ความน่าเชื่อถือ' เป็นตัวเลข และใช้ error budget ตัดสินใจ
Counter, Gauge, Histogram, Summary + กับดัก cardinality ระเบิด
Symptom-based alerting, alert fatigue, และตั้ง alert ที่คนไม่เกลียด
2 · Metrics
Prometheus + Grafana — pillar ที่ repo คุณยังไม่มี เริ่มจากศูนย์
Pull model, scraping, TSDB, service discovery — ทำงานยังไงข้างใน
Instant vs range vector, rate(), histogram_quantile(), aggregation
node_exporter, cAdvisor และการฝัง metric ในโค้ดแอปเอง
Data source, panel, variable, และหลักการออกแบบ dashboard ที่ดูรู้เรื่อง
ตั้ง metrics stack ครบชุดด้วย Docker Compose แล้วดู CPU/RAM ของเครื่องจริง
ฝัง prom-client ในแอป, เขียน RED metrics เอง, ตั้ง Alertmanager
3 · Logs
ELK ที่คุณมีอยู่แล้ว — จัดระเบียบความรู้และต่อยอด
4 · Traces
Distributed Tracing — ตามรอย request ข้าม service ด้วย OpenTelemetry
Span, Trace, Context Propagation — ทำไม log อย่างเดียวไม่พอใน microservices
มาตรฐานกลางของ telemetry: SDK, Collector, OTLP และทำไมมันเปลี่ยนเกม
instrument แอปสอง service, ส่ง trace เข้า Jaeger, ดู waterfall ของ request
5 · Hero (Production)
รวมร่าง 3 pillars และใช้งานจริงในทีมที่มี on-call