结论先行:评估可观测能力,最有效的方式是回答五个递进的问题:能不能看到单笔交易的完整路径、能不能从现象下钻到具体的语句与堆栈、告警能不能说清影响了多少业务、能不能在用户投诉前发现异常、能不能用数据驱动改进。五级自评表的价值不在打分,而在于把"我们上了平台"和"我们真的用起来了"区分开。
五级能力清单
| 级别 | 特征 | 自评问题 | 达标标志 |
|---|---|---|---|
| L1 有指标 | 资源与可用性曲线 | 能否看到每个服务的错误率与耗时趋势 | 核心服务采集覆盖率完整,单位与口径统一 |
| L2 有链路 | 单笔交易可还原 | 给定订单号或用户标识,能否还原完整调用路径 | 核心交易链路端到端贯通,无断点 |
| L3 能下钻 | 从现象到语句与堆栈 | 慢在哪个语句、哪次外部调用、哪个线程 | 排障不再依赖登录主机逐台检索日志 |
| L4 能量化影响 | 技术告警换算业务损失 | 一条告警能否说清影响多少用户与交易 | 告警内容自带影响面与建议处置人 |
| L5 能预判与改进 | 基线预测与复盘闭环 | 能否提前一个业务周期发现异常,复盘结论是否进排期 | 复盘改进项进入迭代计划并验收 |
怎么自评才不作假
- 按业务域分别评。同一家企业里,核心交易系统可能到 L4,后台报表系统还在 L1。给全公司一个分数没有意义,也无法指导投入。
- 用真实故障回放验证。拿最近三个月的一次典型故障,按自评表逐条走一遍。能走通才算达标,功能开启了不算。
- 每一级要三个证据。例如 L2 的证据可以是:一条真实订单的完整链路截图、一次跨服务检索的记录、一份断点清单。只有一个样例不足以说明贯通率。
三类常见误判
- 把"功能已开启"当成"数据已打通"。采集项配置了、探针装上了,但检索时仍然断链,这种情况在异步与消息场景里很常见。
- 只评技术不评使用。大屏做得完整但没人天天看,看板分层没有对应到具体角色,这类能力在自评里应当降级。
- 一次性评估不复评。业务架构在变,服务能力会回退。建议每季度复评一次,并把结果纳入运维例会。
提升顺序建议
顺序比速度重要。先补齐链路贯通(L2),再补下钻与日志联动(L3)——这两级是数据质量的地基。量化业务影响(L4)依赖前两级的完整度,越早做越容易得到失真的结论。预测与复盘闭环(L5)则建立在稳定的基线与规范的复盘机制之上,通常放在最后推进。
落地清单
- 选定两到三个核心业务域作为自评对象,先不要铺开。
- 用最近一次真实故障演练自评,记录卡住的具体环节。
- 把每级的达标标志写成可勾选的清单,而不是形容词。
- 自评结果落到下一季度的改进项,并指定责任人与验收方式。
奇摩在为金融与政企客户做可观测规划时,通常先做一轮五级自评再定建设范围——自评能暴露的差距,往往比需求调研会上听到的更接近真实情况。
