结论先行:告警没人接,问题常常不在检测规则,而在通道设计:所有级别都往同一个群里发,结果是紧急告警被当成背景,中低级别无人认领。可行做法是按「要不要叫醒人」把通道分成两层——叫醒类与留痕类——级别与通道一一对应,再补上恢复通知和通道自身的可达性检查。
「已发送」不等于「有人知道」
平台侧的发送成功率通常是好看的,但发送成功只说明消息出了网关。真正要回答的是两个问题:这条告警有没有到达一个会因此放下手上工作的人;如果没有,多久会被发现。多数失效都发生在第二个问题上——没人发现的告警,和没发出来的告警,结果是一样的。
通道分两层:叫醒类和留痕类
| 层次 | 典型通道 | 适用场景 | 设计要点 |
|---|---|---|---|
| 叫醒类 | 电话、短信、即时通讯直达、值班群里点到人 | 核心链路中断、安全事件、数据面异常 | 数量必须少,只给能在几分钟内动手的级别 |
| 留痕类 | 邮件、工单系统、日志归档、周期报表 | 性能劣化、容量预警、可延后处理的异常 | 必须带接收人和处理时限,否则等同归档 |
两层的分界不在技术,而在「收到之后要不要立刻动手」。把这条标准写清楚,通道和级别的对应关系自然就出来了。反过来,如果一开始就从工具出发去挑通道,很容易出现所有级别都塞进同一个群的情况。
级别到通道:对应关系要写进配置
对应关系建议用一张表固化下来,并且区分常态与特殊时段。特殊时段包括重要活动保障期、结算与结账期、系统割接窗口——这些时段里,同一级别的告警应当走更直接的通道,而不是沿用平时的配置。
另一种要避免的极端是「防漏发」心态:同一条告警同时发到四五个通道。表面上稳妥,实际结果是接收人很快学会忽略其中几个,通道整体的可信度随之下降。一条告警走一条主通道、其余作为留痕,比全部铺开更有效。
有始有终:恢复通知与关闭回执
只发不收回是通道设计的常见缺口。告警恢复后应当有对应的恢复通知,并且从同一通道发出,让收到告警的人知道事情已经过去、不必再去排查。对已经进入处置流程的告警,还需要一条关闭回执:谁处理的、处置动作是什么、是否验证过。没有回执,值班记录就只剩下「响过」,复盘时无法统计。
通道自己也会失效
短信网关会积压、邮件会进垃圾箱、群机器人会被移出。这些都不会在业务监控里体现出来,因为业务本身是正常的。
可行做法是给通道本身做定期自检:按固定周期发送一条测试告警,核对端到端的到达时间;把发送失败与回执缺失单独统计,并入日志平台的日常巡检项;通道配置变更后重跑一次自检。这几件事都不复杂,缺的是把它们当成配置项来管。
边界与前提
其一,通道分层的前提是级别定义已经稳定。级别还在频繁调整时,先不要把映射固化下来。
其二,叫醒类通道涉及个人号码与休息时段,使用范围要与团队约定清楚,避免变成常态化打扰。
其三,通道只是最后一公里,前面还有去重、收敛与关联。通道做得好,不等于告警治理已经做完。
落地清单
- 清点现有通道,按「要不要叫醒人」归入两层。
- 整理级别定义,输出级别与通道的对应表。
- 为核心链路与安全事件单独标注特殊时段通道。
- 为每条告警补上恢复通知,为进入处置流程的告警补上关闭回执。
- 把通道自检加入日常巡检项,配置变更后重跑一次。
- 按季度回看各通道的到达时间与回执缺失率。
奇摩在日志与可观测平台的落地中,通常把告警级别与通道对照表作为交付物之一先行确认,再进入规则调优。需要梳理现有告警链路,可 预约咨询。
