深色模式
RED/USE 方法设计大盘
不知道看板该放什么?RED 管服务、USE 管资源,两套方法论让监控不遗漏关键信号。
适用环境
- 已采集服务指标(请求数、延迟)与主机/容器资源指标
- 准备设计或重构监控大盘
bash
# 确认 RED 所需的请求/延迟指标存在
curl -s 'http://localhost:9090/api/v1/label/__name__/values' | grep -i request1
2
2
操作步骤
1. RED 方法(面向请求的服务)
每个服务看三个黄金信号:
| 信号 | 含义 | 示例 PromQL |
|---|---|---|
| Rate | 每秒请求数 | rate(http_requests_total[5m]) |
| Errors | 错误率 | rate(http_requests_total{code=~"5.."}[5m]) / rate(http_requests_total[5m]) |
| Duration | 延迟分布 | histogram_quantile(0.95, rate(http_request_duration_seconds_bucket[5m])) |
2. USE 方法(面向资源)
每个资源看三个维度:
| 信号 | 含义 | 示例 |
|---|---|---|
| Utilization | 利用率 | 1 - avg(rate(node_cpu_seconds_total{mode="idle"}[5m])) |
| Saturation | 饱和度 | node_load1 / count(node_cpu_seconds_total{mode="idle"}) |
| Errors | 错误 | node_disk_io_errors_total |
3. 组织看板结构
按 “概览 → RED → USE → 拓扑” 分层,每张面板带阈值色带,异常一眼可见。
验证
对照表格逐项确认每个信号都有对应面板;用一个压测制造错误率上升,看大盘是否反映。
常见坑
别只堆指标不看信号
堆 50 个面板不如聚焦 RED/USE 9 个核心信号,过多反而掩盖问题。
延迟只看平均值
平均延迟会掩盖长尾,必须配 P95/P99 分位数面板。