结论先行:很多团队不是告警太少,而是告警太多——同一故障牵出一串重复告警,真正要处理的反而被淹没。告警疲劳治理的核心不是"少发",而是"发得准":通过去重、收敛、关联、分级四步,把同源重复告警合并、把相关告警聚成一个事件,让值班人员只看到该看的。

告警疲劳是怎么来的

一条根因往往触发多层告警:CPU 高、连接池满、接口错误率升、队列堆积,看着是四条,实际是一件事。如果这些告警各走各的通道、各叫各的人,值班人员就得在半夜手动拼图,久而久之对告警整体脱敏,真故障也可能被当成噪音忽略。

四步收敛

  • 去重:同一指标在短时间内重复触发的,合并成一条,只更新计数与最近时间,不重复通知。
  • 收敛:把同一主机、同一链路上同时段冒出的多条告警归到一个事件里,而不是逐条推送。
  • 关联:用调用链或拓扑把相关告警串起来,标出可能的根因方向,减少人工拼接。
  • 分级:只有达到预设重要度的事件才升级到人,低优的留在看板待处理。

治理后看什么数字

别只数"发了多少条",更该看"每人每天要处理的事件数"和"事件从产生到认领的时长"。这两个数字降下来,说明疲劳在缓解;如果只降了告警总量却没人看,治理就还没到位。

奇摩在交付可观测项目时,会把告警收敛规则作为上线前的一项配置,而不是等值班人员抱怨了才补。

若您正被告警淹没、又怕漏掉真故障,欢迎 预约咨询