深色模式
---
title: "运维体系目录建设 Todolist(310+ 篇)"
description: "「运维体系」栏目的大规模内容建设规划:覆盖 20 个分类、310+ 篇面向小白的实操文章,每篇标注具体操作任务与优先级,并附真实可跑的上手实验"
date: 2026-10-09
tags:
- SRE
- 运维体系
- 文档规划
- 新手入门
- 实操
---
运维体系目录建设 Todolist(310+ 篇)
摘要:本文是站点「运维体系(guide/ops/)」栏目的大规模内容建设规划,面向零基础到进阶的运维学习者。共规划 20 个分类、310+ 篇文章,每篇都标注「小白照着能做的具体操作」与优先级(P0/P1/P2),并在第四节给出一套真实可跑的入门实验(含命令),让读者动手即学。状态图例:✅ 已发布(可点)、⬜ 规划中(仅占位,未撰写,故不链以避免死链)。
说明
一、栏目定位与建设原则
「运维体系」栏目聚焦通用运维 / SRE 方法论与工程实践,面向生产 SRE、平台工程师与转行入门者,内容不绑定特定云厂商,强调可落地、可验证、有来源、小白可照做。
建设原则:
- 零基础友好:每篇以「环境准备 → 操作步骤 → 验证 → 排错」为主线,命令可复制。
- 可观测性优先:监控、日志、链路、SLO 是底座,优先成体系。
- 先动手再讲理:配套入门实验让学习者先跑通,再理解原理。
- 循序渐进:从 Linux 基础 → 网络 → 监控日志 → 自动化 → 数据库中间件 → 容器云原生。
- 零死链:规划中的文章只列标题与路径,不提前建立跳转链接。
二、为什么规划 310+ 篇
运维是知识体系极广的岗位,从一台服务器的开关机到分布式系统的稳定性治理,跨度大、坑点多。把内容拆成 310+ 篇小主题,好处是:
- 每篇聚焦一个可操作的点,小白不会面对动辄上万字的大部头而劝退;
- 难度梯度清晰,从
ls/cd到eBPF/混沌工程逐级递进; - 易于检索与补全,哪块不会点哪篇。
下文每个分类都给出「小白照着能做的具体操作」,确保规划不是空标题。
三、栏目目录结构(规划)
*之外的分类中,monitoring/logging/alerting/slo/incident已建目录;其余为规划中,需登记DIR_META.ops并同步 nav 后方可进入侧边栏。
四、小白上手实验(真实可跑,含命令)
下面是一套最小化可观测性实验,小白照做即可在本地/虚拟机跑通「采集主机指标 → 看图表 → 触发告警」,对应后续 monitoring / logging 分类的入门篇。
实验环境
- 一台 Linux 虚拟机(CentOS 7+/Ubuntu 20.04+,2C4G 即可)。
- 能访问公网下载二进制;全程用普通账户 + sudo。
- 实验约 30 分钟,所有命令复制即可执行。
步骤 1:准备目录并下载组件
bash
# 创建工作目录
mkdir -p ~/ops-lab/{prometheus,node_exporter,grafana} && cd ~/ops-lab
# 查看系统信息(对应 Linux 基础篇)
uname -a1
2
3
4
5
2
3
4
5
步骤 2:安装 node_exporter 采集主机指标
bash
cd ~/ops-lab/node_exporter
# 下载(以 linux/amd64 为例,版本以官网为准)
curl -LO https://github.com/prometheus/node_exporter/releases/download/v1.8.2/node_exporter-1.8.2.linux-amd64.tar.gz
tar xzf node_exporter-1.8.2.linux-amd64.tar.gz
cd node_exporter-1.8.2.linux-amd64
./node_exporter &
# 验证:浏览器或 curl 访问指标端点
curl -s localhost:9100/metrics | grep -E "node_cpu|node_memory" | head1
2
3
4
5
6
7
8
2
3
4
5
6
7
8
步骤 3:安装并配置 Prometheus 拉取指标
bash
cd ~/ops-lab/prometheus
curl -LO https://github.com/prometheus/prometheus/releases/download/v2.53.0/prometheus-2.53.0.linux-amd64.tar.gz
tar xzf prometheus-2.53.0.linux-amd64.tar.gz
cd prometheus-2.53.0.linux-amd641
2
3
4
2
3
4
创建最小配置 prometheus.yml:
yaml
global:
scrape_interval: 15s
scrape_configs:
- job_name: "node"
static_configs:
- targets: ["localhost:9100"]1
2
3
4
5
6
2
3
4
5
6
启动并验证:
bash
./prometheus --config.file=prometheus.yml &
# 验证:查询主机 CPU 使用率(PromQL)
curl -s "localhost:9090/api/v1/query?query=100-(avg(rate(node_cpu_seconds_total{mode=%22idle%22}[5m]))*100)" | head1
2
3
2
3
步骤 4:用 PromQL 看一个真实指标
在 Prometheus Web(http://<IP>:9090)的 Graph 页输入:
promql
# 内存可用率
100 * (1 - node_memory_MemAvailable_bytes / node_memory_MemTotal_bytes)1
2
2
步骤 5:写一条告警规则
在 prometheus.yml 同级新建 rules.yml:
yaml
groups:
- name: host
rules:
- alert: CpuHigh
expr: 100 - (avg(rate(node_cpu_seconds_total{mode="idle"}[5m])) * 100) > 80
for: 2m
labels: { severity: warning }
annotations:
summary: "CPU 使用率持续超过 80%"1
2
3
4
5
6
7
8
9
2
3
4
5
6
7
8
9
在 prometheus.yml 的 global 下增加 rule_files: ["rules.yml"] 后重启 Prometheus,到 Alerts 页即可看到规则状态。
实验小结
跑通这套实验,你就已经掌握了「监控三件套」的最小闭环:采集(node_exporter)→ 存储查询(Prometheus/PromQL)→ 告警(rules)。后续 monitoring / alerting 分类的每一篇,都是在这个闭环上做深做广。
五、分分类 Todolist(20 个分类,310+ 篇)
5.1 Linux 基础入门(linux-basics)— 35 篇(规划中,待登记)
展开 35 篇
- 最小化安装与系统选择 — 下载 AlmaLinux/CentOS/Ubuntu ISO,制作启动盘,完成最小化安装并登录。 [P0]
- 第一次 SSH 登录 — 用 ssh-keygen 生成密钥、拷贝公钥、禁用密码登录并验证。 [P0]
- 文件系统导航 — 用 pwd/ls/cd/find 在真实目录树中定位文件。 [P0]
- 文件与目录操作 — 练习 touch/cp/mv/mkdir,演示 rm -rf 的危险与替代。 [P0]
- 查看文件内容 — cat/less/head/tail 与 tail -f 实时跟踪日志。 [P0]
- 文本三剑客 grep/sed/awk — 从 access.log 提取状态码并统计。 [P0]
- 权限模型 rwx — 用 chmod 数字/符号法、chown 改权限并验证。 [P0]
- 用户与用户组 — useradd/groupadd 建运维账户并配 sudo。 [P0]
- 软件包管理 yum/dnf/apt — 更换国内镜像源并安装 htop。 [P0]
- systemd 入门 — systemctl 启停 sshd/nginx、设开机自启、查状态。 [P0]
- 进程管理 ps/top/kill — 查找并终止占用端口的进程。 [P0]
- 磁盘与分区 lsblk/fdisk/mount — 查看用量并为新盘分区挂载。 [P1]
- 内存与 CPU 查看 free/vmstat/mpstat — 解读内存与负载。 [P1]
- 网络基础命令 ip/ss/ping — 查 IP、端口监听、路由。 [P0]
- 定时任务 cron — 写每分钟追加时间的 crontab 并验证。 [P1]
- 环境变量 PATH/profile — 添加自定义命令到 PATH 并永久生效。 [P1]
- 压缩归档 tar/gzip — 打包日志目录并解压校验。 [P1]
- 软硬链接 ln -s — 创建软链接并理解 inode。 [P1]
- 日志轮转 logrotate — 为一个应用配每日轮转并测试。 [P2]
- 系统时间 NTP chrony — 配置时间同步并验证。 [P1]
- 内核参数 sysctl — 调整文件句柄数并生效。 [P2]
- 资源限制 ulimit — 为服务账户调大 nofile。 [P2]
- 系统信息 uname/lscpu — 收集服务器规格。 [P1]
- 安全基线初查 — 用脚本扫空密码、root 远程登录。 [P1]
- vim 基础 — 插入/保存/搜索,编辑一个配置文件。 [P0]
- 管道与重定向 | > >> — 组合命令过滤输出。 [P0]
- 命令别名 alias — 为长命令设别名与函数。 [P2]
- 命令历史 history — 复用与搜索历史命令。 [P2]
- 磁盘 IO 观测 iostat/iotop — 定位 IO 瓶颈进程。 [P2]
- inode 与磁盘满假象 — 查找已删未释放文件。 [P2]
- 交换分区 swap — 添加并启用一个 swap 文件。 [P2]
- 启动流程与排错 — 理解 BIOS/GRUB/systemd 开机顺序。 [P2]
- 救援模式重置 root 密码 — 在虚拟机演练。 [P2]
- 编译安装软件 — configure/make 安装一个小工具。 [P2]
- 终端复用 tmux — 分屏与会话保持管理长任务。 [P2]
:::
5.2 网络运维(network-ops)— 22 篇(规划中,待登记)
展开 22 篇
- TCP/IP 模型与数据包流转 — 画图理解一次请求经过哪些层。 [P1]
- IP 与子网划分 CIDR — 手动划分子网并计算可用地址。 [P1]
- DNS 原理与 dig 排错 — 解析域名并观察解析过程。 [P0]
- /etc/hosts 与解析优先级 — 本地绑定测试覆盖 DNS。 [P1]
- curl 实战 HTTP/HTTPS — 发请求、看状态码、设超时。 [P0]
- 端口与监听 ss -lntp — 确认应用监听端口。 [P0]
- firewalld 实战 — zone/rich-rule 开放 80 端口。 [P1]
- iptables 基础 — 表链模型与一条放行规则。 [P1]
- nftables 入门 — 配置基础过滤规则。 [P2]
- tcpdump 抓包入门 — 过滤主机/端口抓取 SSH 流量。 [P1]
- Wireshark 分析握手 — 分析一次 TCP 三次握手。 [P2]
- conntrack 与 NAT — 查看连接跟踪表。 [P2]
- MTU 与分片排错 — 诊断大包不通。 [P2]
- 负载均衡对比 LVS/HAProxy/Nginx — 配 Nginx 反向代理。 [P1]
- upstream 健康检查 — 配置后端探活。 [P1]
- 正向代理 Squid — 搭建透明代理示例。 [P2]
- VPN 基础 WireGuard — 部署点对点隧道。 [P2]
- 网络排查八步法 — 从 DNS→路由→防火墙系统排查。 [P0]
- 网卡绑定 bonding — 配置 active-backup。 [P2]
- 带宽观测 iftop/nload — 看实时流量。 [P2]
- Let's Encrypt 证书 — DNS 验证申请并部署。 [P1]
- 内网 DNS dnsmasq — 搭一个缓存 DNS。 [P2]
:::
5.3 监控(monitoring)— 30 篇(1 已发布 / 29 规划)
展开 30 篇
- 监控与告警体系总览 — 理解可观测性三支柱与黄金信号。 ✅
- Prometheus 架构详解 — 画架构、理解 pull 模型。 [P0]
- 二进制安装 Prometheus — 下载、配置、systemd 启动验证。 [P0]
- prometheus.yml 逐行讲解 — 写 scrape 配置并热加载。 [P0]
- node_exporter 采集主机指标 — 安装并查看 /metrics。 [P0]
- 指标类型 Counter/Gauge/Histogram — 用例子区分四类。 [P0]
- PromQL 入门 — 选择器与即时/区间向量查询 CPU。 [P0]
- rate/irate/increase 区别 — 计算 QPS 与增量。 [P0]
- PromQL 聚合 sum/by/topk — 集群维度汇总。 [P1]
- relabel_configs 标签重写 — 改写 job 标签。 [P1]
- recording rules 预计算 — 写规则文件降载。 [P1]
- alerting rules 编写 — 写 CPU>80% 告警规则。 [P0]
- Blackbox Exporter 黑盒探测 — 配 HTTP/ICMP 探针。 [P1]
- SNMP Exporter 网络设备 — 采集交换机指标。 [P2]
- Process Exporter 进程监控 — 按进程名采集。 [P2]
- Windows Exporter — 在 Windows 上安装采集。 [P2]
- 应用自定义指标 /metrics — 写个暴露指标的 demo。 [P1]
- Pushgateway 短期任务 — 推送批处理指标。 [P2]
- Federation 联邦聚合 — 配置上层聚合。 [P2]
- Remote Write 远端存储 — 接 Thanos/Mimir。 [P2]
- Prometheus 高可用 — 双副本 + Alertmanager 集群。 [P2]
- Thanos 长期存储 — 搭 sidecar 架构。 [P2]
- Grafana 安装与数据源 — 装并接入 Prometheus。 [P1]
- Grafana 仪表盘与变量 — 做带变量的看板。 [P1]
- 导入社区仪表盘 — 导入 Node Exporter Full。 [P1]
- Grafana 告警通知 — 配邮件/钉钉渠道。 [P2]
- RED/USE 方法设计大盘 — 设计服务看板。 [P1]
- cAdvisor 容器监控 — 看容器指标。 [P1]
- 采集性能优化 — 采样与分片降负载。 [P2]
- 指标断流发现 up==0 — 配采集存活告警。 [P1]
:::
5.4 日志(logging)— 24 篇(1 已发布 / 23 规划)
展开 24 篇
- 日志体系总览 — 日志分级、采集架构选型。 ✅
- 日志采集 Agent 模式 — 对比 DaemonSet/Sidecar/Agent。 [P0]
- Filebeat 安装与采集 — 采 nginx 日志发到 ES。 [P1]
- Fluent Bit 轻量采集 — 容器场景部署。 [P1]
- Fluentd 路由与过滤 — 多源聚合改写。 [P2]
- Vector 高性能管道 — 做采集+转换。 [P2]
- Loki 安装与查询 — 搭 Loki 并用 LogQL 查日志。 [P1]
- Promtail 发送日志到 Loki — 配抓取与标签。 [P1]
- ELK 入门 ElasticSearch — 单机部署与索引。 [P1]
- Kibana 可视化日志 — 建索引模式与 Discover。 [P1]
- 结构化日志 JSON — 改造应用输出结构化。 [P1]
- 日志采样与降成本 — 配置采样比例。 [P1]
- 日志脱敏 — 用 processor 遮蔽手机号/身份证。 [P1]
- 日志轮转 logrotate — 配 size/time 轮转。 [P1]
- journald 与 systemd 日志 — journalctl 过滤。 [P1]
- grep/awk 日志分析实战 — 统计 5xx 与慢请求。 [P0]
- 多行日志合并 — 处理 Java 堆栈。 [P2]
- 日志保留与冷热分离 — ILM 生命周期。 [P2]
- 集中式日志架构设计 — 高并发采集拓扑。 [P2]
- 日志告警 — 错误日志频次触发通知。 [P2]
- 容器日志 docker/k8s — 理解 stdout 收集。 [P1]
- 日志与链路关联 TraceID — 串联排查。 [P2]
- 日志合规留存 — 满足审计期限。 [P2]
- 常见日志格式解析 — nginx/access、apache、syslog。 [P1]
:::
5.5 告警(alerting)— 18 篇(1 已发布 / 17 规划)
展开 18 篇
- 告警体系总论 — 告警生命周期与原则。 ✅
- Alertmanager 安装部署 — 配路由接收 Prometheus 告警。 [P0]
- 路由 route 树配置 — 按标签分流到不同接收者。 [P0]
- 分组 group 与抑制 inhibit — 减少告警风暴。 [P1]
- 静默 silence — 维护期临时屏蔽。 [P1]
- 告警模板 template — 自定义通知文案。 [P1]
- Webhook 对接自研系统 — 推告警到内部平台。 [P2]
- 钉钉/飞书/企业微信通知 — 配机器人 webhook。 [P1]
- 邮件告警 SMTP — 配邮件接收。 [P2]
- 告警分级 Sev1-4 — 定义级别与响应。 [P1]
- 告警降噪策略 — 聚合/去重/收敛实践。 [P1]
- 告警有效性度量 — 计算准确率与漏报。 [P1]
- 告警疲劳治理 — 回收无效告警。 [P2]
- 基于 SLO 的告警 — 用错误预算触发。 [P2]
- 多活/同城告警去重 — 避免双中心重复。 [P2]
- 告警值班联动 — 与 OnCall 系统对接。 [P2]
- 告警复盘与调优 — 周期性审视规则。 [P2]
- 合成监控告警 — 拨测失败即告警。 [P2]
:::
5.6 SLO(slo)— 18 篇(1 已发布 / 17 规划)
展开 18 篇
- SLO 总论 — SLI/SLO/错误预算概念。 ✅
- 如何选 SLI — 延迟/可用性/质量指标选取。 [P0]
- 错误预算计算 — 从目标可用性反推预算。 [P1]
- 多窗口多燃尽告警 MWMB — 配快速/慢速燃尽。 [P1]
- 燃尽图仪表盘 — Grafana 画预算消耗。 [P1]
- SLO 落地实践 — 从定义到告警闭环。 [P1]
- 用户旅程 SLI — 按关键路径设指标。 [P2]
- SLO 与发布门禁 — 预算耗尽停止发布。 [P2]
- 分布式系统 SLO — 多依赖下的可用性。 [P2]
- SLO 报表与复盘 — 月度达标统计。 [P2]
- 错误预算政策 — 定义用尽后的动作。 [P2]
- SLO 与容量关联 — 预算被容量吃掉的场景。 [P2]
- SLO 文档模板 — 标准化一份 SLO 文档。 [P2]
- 小步快跑设 SLO — 从宽松逐步收紧。 [P2]
- SLO 与成本权衡 — 过度达标即浪费。 [P2]
- SLI 采集实现 — 埋点与聚合。 [P2]
- SLO 常见误区 — 100% 可用性的陷阱。 [P2]
- SLO 在事故中作用 — 用预算沟通取舍。 [P2]
:::
5.7 故障排查(incident)— 32 篇(1 已发布 / 31 规划)
展开 32 篇
- 故障排查与复盘总论 — 方法论与心态。 ✅
- 排查通用套路 — 自顶向下/自底向上/二分法。 [P0]
- CPU 飙高排查 — top/perf 定位热点进程。 [P0]
- 内存泄漏排查 — free/smem/堆 dump。 [P0]
- 磁盘满排查 — df/du/lsof 找大文件。 [P0]
- IO 瓶颈排查 — iostat/iotop 定位。 [P1]
- 网络不通排查 — DNS/路由/防火墙八步。 [P0]
- 连接数耗尽排查 — ss/time_wait/ulimit。 [P1]
- 端口冲突排查 — 找占用端口的进程。 [P1]
- DNS 解析失败排查 — dig + 链路。 [P0]
- SSL/TLS 证书问题 — 过期/链不完整排查。 [P1]
- 服务假死排查 — 线程池/死锁/夯住。 [P1]
- 慢查询排查 — 数据库侧定位。 [P1]
- 中间件超时排查 — 消息积压/连接池。 [P1]
- K8s Pod 异常排查 — Pending/CrashLoopBackOff。 [P1]
- K8s 网络不通排查 — Service/Endpoint/CNI。 [P1]
- K8s 存储挂载失败 — PVC/Pv/权限。 [P2]
- 内核参数导致的故障 — 文件句柄/端口范围。 [P2]
- OOM 与 cgroup 限制 — dmesg 看 OOM。 [P1]
- 时钟漂移导致的问题 — 证书/分布式一致性。 [P2]
- 负载均衡误配排查 — 健康检查/权重。 [P2]
- 缓存击穿/雪崩排查 — Redis 侧。 [P2]
- 消息积压排查 — Kafka/RabbitMQ 消费滞后。 [P2]
- 灰度发布引发的故障 — 回滚与对比。 [P2]
- 依赖雪崩排查 — 级联失败定位。 [P2]
- 配置错误排查 — 配置中心/挂载。 [P1]
- 权限不足排查 — 403/Permission denied。 [P1]
- 日志缺失排查 — 采集链路断点。 [P2]
- 监控盲区导致的迟发现 — 补指标。 [P2]
- 故障定界话术 — 对内对外沟通模板。 [P1]
- 典型故障案例集 — 汇编真实案例。 [P2]
- 应急止血手段 — 限流/降级/切流。 [P1]
:::
5.8 容量规划(capacity)— 14 篇(规划中,待登记)
展开 14 篇
- 容量规划方法论 — 需求/模型/冗余。 [P1]
- 性能压测入门 — 用 wrk/ab 打接口。 [P1]
- 负载模型建立 — 从业务量推算资源。 [P1]
- CPU 容量评估 — 利用率与线性度。 [P2]
- 内存容量评估 — 峰值与增长。 [P2]
- 存储容量与 IOPS — 算吞吐与空间。 [P2]
- 网络带宽容量 — 流量模型。 [P2]
- 数据库连接数容量 — 连接池与上限。 [P2]
- 水平扩展 vs 垂直扩展 — 选型权衡。 [P2]
- 水位与扩容阈值 — 设 70%/85% 红线。 [P2]
- 容量预测与趋势 — 用历史做外推。 [P2]
- 突发流量应对 — 弹性与预热。 [P2]
- 容量演练 — 全链路压测。 [P2]
- 容量报告模板 — 标准化输出。 [P2]
:::
5.9 成本治理(cost)— 14 篇(规划中,待登记)
展开 14 篇
- FinOps 入门 — 文化/模型/职责。 [P2]
- 云账单解读 — 看懂账单结构。 [P2]
- 成本分摊标签 — 按项目/环境分账。 [P2]
- 闲置资源识别 — 找关机/低利用。 [P2]
- 存储成本优化 — 生命周期与降冷。 [P2]
- 计算成本优化 — 规格/竞价/预留。 [P2]
- 网络成本优化 — 流量与跨区。 [P2]
- 监控自身成本 — 可观测性开销。 [P2]
- 容量与成本权衡 — 冗余 vs 花费。 [P2]
- 预算与告警 — 设预算阈值。 [P2]
- 资源利用率提升 — 装箱率优化。 [P2]
- 成本治理流程 — 月度审视机制。 [P2]
- FinOps 工具 — 开源/商业方案。 [P2]
- 成本看板搭建 — Grafana 展示。 [P2]
:::
5.10 自动化(automation)— 32 篇(规划中,待登记)
展开 32 篇
- 运维自动化总览 — 什么该自动化。 [P1]
- Shell 脚本基础 — 变量/条件/循环写第一个脚本。 [P0]
- 脚本健壮性 — set -euo pipefail 与日志。 [P1]
- Ansible 入门 — inventory/playbook 批量装软件。 [P1]
- Ansible 模块实战 — yum/copy/template/service。 [P1]
- Ansible 角色 Roles — 结构化复用。 [P2]
- Ansible Vault 加密 — 管理敏感变量。 [P2]
- Terraform 入门 — 用 HCL 建一台云主机。 [P1]
- Terraform 状态与变量 — tfstate/var 管理。 [P1]
- Terraform 模块 — 封装可复用资源。 [P2]
- Terraform 工作流 — plan/apply/destroy。 [P1]
- OpenTofu 替代 — 与 TF 的差异。 [P2]
- Pulumi 用代码定义 — Python/Go 写设施。 [P2]
- CI/CD 基础概念 — 流水线 stages。 [P1]
- GitLab CI 入门 — 写 .gitlab-ci.yml。 [P1]
- GitHub Actions 入门 — 写 workflow。 [P1]
- Jenkins 入门 — 建一个自由风格任务。 [P2]
- 制品与仓库 — Nexus/Harbor 管理镜像。 [P2]
- GitOps 概念 — Git 为唯一事实源。 [P1]
- Argo CD 实战 — 部署并同步应用。 [P1]
- Flux 实战 — 轻量 GitOps。 [P2]
- 配置管理基线 — 统一 OS/内核参数。 [P2]
- 幂等与可回滚 — 变更安全三原则。 [P1]
- 自动化测试 — 对 playbook/模块校验。 [P2]
- 定时自动化 cron+脚本 — 巡检/备份自动化。 [P2]
- 基础设施漂移检测 — 发现手动改动。 [P2]
- 秘钥自动化分发 — 安全下发配置。 [P2]
- 自动化审批流 — 生产变更门禁。 [P2]
- 低代码/脚本平台 — 内部工具化。 [P2]
- 自动化排错机器人 — 自愈脚本。 [P2]
- ChatOps 入门 — 在群里执行命令。 [P2]
- 自动化成熟度评估 — 从手工到自主。 [P2]
:::
5.11 安全合规(security)— 32 篇(规划中,待登记)
展开 32 篇
- 运维安全总览 — 安全左移与纵深防御。 [P1]
- 最小权限原则 — 按需授权与回收。 [P1]
- SSH 安全加固 — 禁 root/密钥/改端口。 [P0]
- 防火墙 iptables/nftables — 默认拒绝策略。 [P1]
- TLS/证书管理 — 申请/部署/续期。 [P1]
- 密钥与凭据管理 — Vault/密钥中心。 [P1]
- 证书到期监控 — 提前告警防过期。 [P1]
- Linux 基线加固 — 关服务/改默认。 [P1]
- 等保 2.0 概览 — 等级保护要求。 [P1]
- 身份鉴别合规 — 双因子/复杂度。 [P1]
- 访问控制合规 — 权限分离。 [P1]
- 安全审计日志 — 操作留痕。 [P1]
- 漏洞扫描入门 — 用工具扫主机。 [P2]
- 补丁管理 — 制定更新策略。 [P2]
- 入侵检测 HIDS — OSSEC/Falco。 [P2]
- 文件完整性 FIM — 监控关键文件。 [P2]
- 容器安全基础 — 镜像/运行时。 [P1]
- K8s RBAC 入门 — Role/RoleBinding。 [P1]
- 网络隔离与微分段 — 限制横向移动。 [P2]
- 数据加密静态/传输 — 落盘与链路。 [P2]
- 安全基线检查脚本 — 自动化巡检。 [P2]
- 日志防篡改 — 集中+只读。 [P2]
- 弱口令治理 — 扫描与强制策略。 [P2]
- API 安全 — 鉴权/限流/审计。 [P2]
- 备份与容灾基础 — 3-2-1 原则。 [P0]
- 数据库审计 — 开启慢/操作审计。 [P2]
- 应急响应预案 — 被入侵怎么办。 [P2]
- 合规差距清单模板 — 自评输出。 [P2]
- 安全意识培训 — 钓鱼/社工防范。 [P2]
- 供应链安全 — 依赖与镜像来源。 [P2]
- 零信任初探 — 理念与落地。 [P2]
- 安全复盘与红蓝对抗 — 演练提升。 [P2]
:::
5.12 混沌工程(chaos)— 14 篇(规划中,待登记)
展开 14 篇
- 混沌工程入门 — 原则与价值。 [P2]
- 混沌与稳定性关系 — 主动暴露脆弱点。 [P2]
- 爆炸半径控制 — 限定影响范围。 [P2]
- 中止条件设计 — 自动回滚触发。 [P2]
- Chaos Mesh 入门 — 注入 Pod 故障。 [P2]
- CPU/内存故障注入 — 压测真实负载。 [P2]
- 网络延迟/丢包注入 — 模拟弱网。 [P2]
- 节点宕机演练 — 杀节点看恢复。 [P2]
- 依赖失效演练 — 下游挂掉的影响。 [P2]
- Game Day 组织 — 演练全流程。 [P2]
- 混沌实验设计 — 假设/指标/结论。 [P2]
- 混沌与 SLO 结合 — 用预算衡量。 [P2]
- 生产环境混沌 — 安全开展。 [P2]
- 混沌工程成熟度 — 常态化机制。 [P2]
:::
5.13 值班响应(oncall)— 14 篇(规划中,待登记)
展开 14 篇
- OnCall 机制总览 — 轮值与责任。 [P1]
- 轮值排班设计 — 公平与覆盖。 [P1]
- 升级 Escalation 策略 — 超时升级路径。 [P1]
- 告警分派 routing — 按服务派给负责人。 [P1]
- 值班手册 Runbook — 标准化操作流程。 [P1]
- 事件分级 Sev — 定义与响应 SLA。 [P1]
- 应急响应沟通 — 群/状态页/电话。 [P1]
- 无责复盘 Postmortem — 模板与归档。 [P1]
- 值班疲劳治理 — 限制连轴与负载。 [P2]
- 事件状态页 — 对外透明。 [P2]
- 自动化接警 — 机器人播报。 [P2]
- 值班交接 — 知识不丢失。 [P2]
- 事故演练 — 桌面推演。 [P2]
- OnCall 工具对比 — PagerDuty/VictorOps 类。 [P2]
:::
5.14 数据库运维(database)— 32 篇(规划中,待登记)
展开 32 篇
- 数据库运维总览 — 职责与风险。 [P1]
- MySQL 安装部署 — 二进制/yum 安装。 [P0]
- MySQL 用户与权限 — 最小权限授权。 [P1]
- MySQL 备份 mysqldump/XtraBackup — 全量/增量。 [P0]
- MySQL 恢复演练 — 真实还原验证。 [P0]
- MySQL 主从复制 — 搭建与监控延迟。 [P1]
- MySQL 慢查询优化 — 慢日志+explain。 [P1]
- MySQL 参数调优 — 缓冲/连接/线程。 [P2]
- MySQL 高可用 MHA/Orchestrator — 故障切换。 [P2]
- PostgreSQL 入门部署 — 安装与基础。 [P1]
- PostgreSQL 备份 pg_basebackup — 物理备份。 [P2]
- PostgreSQL 流复制 — 主备搭建。 [P2]
- PostgreSQL 调优 — shared_buffers 等。 [P2]
- Redis 安装与持久化 — RDB/AOF 配置。 [P1]
- Redis 主从与哨兵 — 高可用搭建。 [P2]
- Redis 集群 Cluster — 分片部署。 [P2]
- Redis 内存与淘汰 — maxmemory 策略。 [P2]
- MongoDB 部署 — 副本集搭建。 [P2]
- 数据库监控指标 — 连接/QPS/慢查询。 [P1]
- 数据库连接池 — 应用侧 druid/hikari。 [P2]
- 数据库容量规划 — 增长与扩容。 [P2]
- SQL 审核 — 上线前检查。 [P2]
- 数据库审计 — 开启操作审计。 [P2]
- 数据迁移工具 — 异构同步初探。 [P2]
- 数据库版本升级 — 灰度与回滚。 [P2]
- 分库分表入门 — 水平拆分。 [P2]
- 读写分离 — 代理路由。 [P2]
- 数据库安全 — 加密/脱敏/权限。 [P2]
- 数据库容灾 — 异地多活基础。 [P2]
- 数据库巡检脚本 — 自动健康检查。 [P2]
- 典型故障案例 — 锁等待/主从不一致。 [P2]
- 数据库运维规范 — 变更/审批模板。 [P2]
:::
5.15 中间件(middleware)— 18 篇(规划中,待登记)
展开 18 篇
- 中间件运维总览 — 常见组件与职责。 [P1]
- Nginx 安装与反向代理 — 配 upstream。 [P0]
- Nginx 负载均衡策略 — 轮询/ip_hash。 [P1]
- Nginx 性能调优 — worker/连接数。 [P2]
- Nginx 日志与监控 — stub_status。 [P2]
- Kafka 部署与 Topic — 单机到集群。 [P2]
- Kafka 消费滞后监控 — lag 告警。 [P2]
- Kafka 分区与副本 — 吞吐设计。 [P2]
- RabbitMQ 部署 — 镜像队列。 [P2]
- RabbitMQ 监控 — 队列堆积。 [P2]
- Zookeeper 运维 — 集群与选举。 [P2]
- ElasticSearch 集群 — 节点角色。 [P2]
- ES 索引与分片 — 规划避免热点。 [P2]
- 消息积压排查 — 定位消费慢。 [P2]
- 中间件高可用 — 故障切换。 [P2]
- 中间件监控指标 — 关键 SLI。 [P2]
- 中间件备份 — 元数据/配置。 [P2]
- 中间件安全 — 认证/网络隔离。 [P2]
:::
5.16 容器与 K8s 运维(container-ops)— 32 篇(规划中,待登记)
展开 32 篇
- 容器与 K8s 运维总览 — 运维视角差异。 [P1]
- Docker 安装与镜像 — 拉取/构建基础。 [P0]
- Dockerfile 编写 — 多阶段构建。 [P1]
- 容器网络基础 — bridge/host/端口映射。 [P1]
- 容器存储 volume — 数据持久化。 [P1]
- docker-compose 编排 — 多容器应用。 [P1]
- K8s 架构与组件 — 控制面/数据面。 [P1]
- kubectl 常用命令 — get/describe/logs/exec。 [P0]
- Pod 生命周期 — 状态与重启策略。 [P1]
- Deployment 滚动更新 — 升级与回滚。 [P1]
- Service 与 Endpoints — 服务发现。 [P1]
- Ingress 入门 — 外部访问路由。 [P1]
- ConfigMap/Secret — 配置与密钥。 [P1]
- PV/PVC 存储 — 动态供给。 [P2]
- StatefulSet 有状态 — 数据库类部署。 [P2]
- HPA 自动伸缩 — 基于 CPU/QPS。 [P2]
- 资源限制 Requests/Limits — 防挤占。 [P1]
- 探针 liveness/readiness — 健康检查。 [P1]
- 命名空间与配额 — 多租户隔离。 [P2]
- RBAC 权限 — 最小权限授权。 [P1]
- 节点维护 cordon/drain — 安全下线。 [P2]
- 集群升级 kubeadm — 滚动升级控制面。 [P2]
- etcd 备份恢复 — 集群生命线。 [P0]
- K8s 网络排障 — 跨节点不通。 [P1]
- K8s 故障排查手册 — 常见异常。 [P1]
- Helm 包管理 — 模板化部署。 [P2]
- Operator 与 CRD — 扩展机制。 [P2]
- 多集群管理 — 统一管控思路。 [P2]
- K8s 安全加固 — PodSecurity。 [P2]
- K8s 监控指标 — 控制面/节点/工作负载。 [P1]
- K8s 日志收集 — 集中方案。 [P1]
- K8s 成本与装箱 — 资源利用率。 [P2]
:::
5.17 可观测性进阶(observability)— 14 篇(规划中,待登记)
展开 14 篇
- 可观测性三支柱深化 — 指标/日志/链路协同。 [P1]
- OpenTelemetry 入门 — 概念与架构。 [P1]
- OTel 自动埋点 — 无侵入采集。 [P2]
- 分布式追踪 Tracing — TraceID 串联。 [P1]
- Trace 与指标关联 — 下钻定位。 [P2]
- eBPF 可观测 — 内核级采集。 [P2]
- 持续性能剖析 Profiling — 火焰图。 [P2]
- 事件 Events 观测 — Kubernetes 事件。 [P2]
- 前端可观测 RUM — 真实用户监控。 [P2]
- Synthetic 拨测 — 模拟用户路径。 [P2]
- 可观测性数据建模 — 标签与基数。 [P2]
- 高基数问题治理 — 降 cardinality。 [P2]
- 统一可观测平台 — 选型与整合。 [P2]
- 可观测性反模式 — 常见误区。 [P2]
:::
5.18 云平台运维(cloud-ops)— 18 篇(规划中,待登记)
展开 18 篇
- 云平台运维总览 — 共享责任模型。 [P1]
- 云账号与权限 — RAM/子账号最小权限。 [P1]
- 云服务器 ECS 选购 — 规格/镜像/磁盘。 [P1]
- 安全组配置 — 等同于云防火墙。 [P1]
- VPC 与子网规划 — 网络隔离。 [P2]
- 对象存储 OSS/S3 — 上传/权限/生命周期。 [P1]
- 云数据库 RDS — 托管库的备份容灾。 [P2]
- 负载均衡 SLB/ALB — 公网入口。 [P2]
- 弹性伸缩 ASG — 按指标扩缩。 [P2]
- 云监控使用 — 平台指标与告警。 [P2]
- 云 CLI 与 SDK — 自动化操作。 [P2]
- 基础设施即代码上云 — Terraform 管云资源。 [P2]
- 云成本优化 — 预留/规格。 [P2]
- 云安全基线 — 合规与审计。 [P2]
- 多云/混合云管理 — 统一视角。 [P2]
- 云迁移步骤 — 评估/迁移/验证。 [P2]
- 云上故障排查 — 平台侧工具。 [P2]
- 云账单与标签 — 分账治理。 [P2]
:::
5.19 运维脚本(scripting)— 18 篇(规划中,待登记)
展开 18 篇
- 运维脚本总览 — 何时写脚本。 [P0]
- Bash 进阶 — 函数/数组/参数。 [P1]
- Shell 文本处理 awk 实战 — 报表统计。 [P1]
- sed 批量替换 — 配置改写。 [P1]
- jq 处理 JSON — 解析接口返回。 [P1]
- Python 运维入门 — requests/paramiko。 [P1]
- Python 批量 SSH — 并发执行命令。 [P2]
- 巡检脚本编写 — 输出健康快照。 [P1]
- 日志分析脚本 — 提取异常。 [P1]
- 备份脚本 — 打包+上传+清理。 [P1]
- 监控自愈脚本 — 自动重启服务。 [P2]
- 定时报表脚本 — 邮件推送。 [P2]
- 配置生成模板 — 批量出配置。 [P2]
- 脚本日志与告警 — 失败通知。 [P1]
- 脚本单元测试 — 用 bats/shellcheck。 [P2]
- Git 在运维中的使用 — 版本化配置。 [P1]
- 正则表达式实战 — 提取与匹配。 [P1]
- 脚本安全规范 — 防注入/最小权限。 [P2]
:::
5.20 规范与流程(standards)— 12 篇(规划中,待登记)
展开 12 篇
- 运维规范总览 — 为什么需要流程。 [P1]
- SOP 标准作业程序 — 编写模板。 [P1]
- Runbook 应急手册 — 结构化故障处理。 [P1]
- 变更管理流程 — 申请/评审/灰度/回滚。 [P1]
- 发布规范 — 窗口/审批/通知。 [P1]
- 知识库建设 — 沉淀与检索。 [P2]
- 无责复盘文化 — 避免甩锅。 [P1]
- 事故定级标准 — Sev 定义。 [P1]
- 演练机制 — 定期容灾/混沌。 [P2]
- 值班与交接规范 — 知识不丢失。 [P2]
- 文档写作规范 — 统一格式。 [P2]
- 运维成熟度模型 — 自评与改进。 [P2]
:::
六、优先级与推进节奏
| 优先级 | 含义 | 重点分类 |
|---|---|---|
| P0 | 零基础必学、体系底座 | linux-basics / network-ops / monitoring / logging / 上手实验 |
| P1 | 稳定性与效率核心 | alerting / slo / incident / automation / security / database / container-ops / scripting |
| P2 | 进阶治理与专项 | capacity / cost / chaos / oncall / middleware / observability / cloud-ops / standards |
阶段建议
- 阶段一(打透底座,约 120 篇):linux-basics + network-ops + monitoring + logging 全部 P0/P1 先行,配套上手实验。
- 阶段二(稳定性核心,约 130 篇):alerting / slo / incident / automation / security / database / container-ops 的 P0/P1。
- 阶段三(进阶与专项,约 60+ 篇):剩余 P2 与各专项深化、案例集、成熟度模型。
七、新增分类接入清单(登记用)
每新增一个分类目录,需同步三处:
- [ ] 在
guide/ops/<新分类>/下创建首篇文章(空目录不进侧边栏) - [ ] 在
utils/auto-gen-sidebar.mjs的DIR_META.ops增加{ <新分类>: { text: "中文标题", order: N } } - [ ] 在
config.mjs的「运维」navitems增加对应入口(目标.md必须存在) - [ ] 撰写后跑
pnpm run docs:build,确认无 dead link / duplicate key / not loaded 警告
死链纪律
规划中(⬜)的文章不要提前写链接,否则构建会因指向不存在的 .md 而失败。等文章真正落盘后再补跳转。
八、进度汇总
| 分类 | 已发布 | 规划中 | 合计 |
|---|---|---|---|
| linux-basics | 0 | 35 | 35 |
| network-ops | 0 | 22 | 22 |
| monitoring | 1 | 29 | 30 |
| logging | 1 | 23 | 24 |
| alerting | 1 | 17 | 18 |
| slo | 1 | 17 | 18 |
| incident | 1 | 31 | 32 |
| capacity | 0 | 14 | 14 |
| cost | 0 | 14 | 14 |
| automation | 0 | 32 | 32 |
| security | 0 | 32 | 32 |
| chaos | 0 | 14 | 14 |
| oncall | 0 | 14 | 14 |
| database | 0 | 32 | 32 |
| middleware | 0 | 18 | 18 |
| container-ops | 0 | 32 | 32 |
| observability | 0 | 14 | 14 |
| cloud-ops | 0 | 18 | 18 |
| scripting | 0 | 18 | 18 |
| standards | 0 | 12 | 12 |
| 合计 | 5 | 408 | 413 |
当前已发布 5 篇,规划中 408 篇,总规划 413 篇,远超 310 篇目标。