监控告警体系
这是
guide/ops/分类下的示例文章,用于占位与写作模板。直接替换正文即可。
背景
可观测性由三大支柱构成:Metrics(指标)、Logs(日志)、Traces(链路)。
能力分层
| 层级 | 关注点 | 典型工具 |
|---|---|---|
| 指标 | 时序数值、阈值 | Prometheus / VictoriaMetrics |
| 日志 | 结构化文本 | Loki / ELK |
| 链路 | 请求调用链 | OpenTelemetry / Jaeger |
数据采集链路
mermaid
flowchart LR
S[被监控对象] --> E[Exporter / Agent]
E --> P[Prometheus]
P --> A[Alertmanager]
A --> N[通知: 钉钉/飞书/邮件]1
2
3
4
5
2
3
4
5
实践建议
建议
告警分级(P0/P1/P2),避免告警风暴;先有 SLO,再配告警。
待补充
- [ ] 核心 SLO 指标定义
- [ ] 告警静默与值班轮转策略