结论先行:网络自动化平台的价值建立在"纳管得全、采得准"之上。纳管率不到百分之百时,路径计算会漏算途经设备、存量策略治理会漏掉未纳管设备的风险规则、应急封堵会留下死角。可行做法是把纳管率和采集健康度当成一级运营指标:先定义口径与基线,再按失败原因分三类处理(认证类、连通类、解析类),最后把健康度巡检固化成周任务并绑定责任人。

纳管不全的三个直接后果

使用场景纳管缺失的影响典型表现
路径计算与策略下发漏算途经设备,配置不完整业务开通后仍不通,反复返工提单
存量策略治理部分设备的僵尸策略与宽泛策略扫不到治理报告看起来干净,审计时仍被查出高危规则
应急封堵部分边界设备未收到黑名单封堵演练报成功,实际仍有链路未覆盖

这三件事的共同点是:平台输出的结果看起来是成功的,但覆盖面存在缺口。因此纳管率必须是持续跟踪的指标,而不是上线时检查一次。

先定口径:三项指标怎么算

指标计算口径基线建议告警阈值
纳管率已纳管设备数 ÷ 资产台账内应有设备数生产网核心与边界设备百分之百低于基线即告警
采集成功率周期内成功采集次数 ÷ 应采集次数按设备类型分别设定连续两个周期失败即告警
数据新鲜度当前时间 − 最近一次成功采集时间不超过一个采集周期的两倍超时即标记为待处理

口径要和业务方对齐:哪些设备在范围内、哪些是测试环境、哪些是已申请豁免的存量设备。口径不清,指标再好看也没有意义。

三类失败原因与处理办法

类别典型原因排查动作常见责任方
认证类账号权限不足、认证方式变更、口令过期用平台账号手工登录验证,核对权限级别安全与账号管理
连通类管理口不可达、中间策略限制、连接超时从平台侧做连通性测试,核对管理网段策略网络运维
解析类命令回显格式变化、版本升级后语法差异、长回显被截断抓取原始回显与解析模板比对,补充适配平台实施

三类原因的处理成本差别很大:认证类和连通类通常在运维侧就能解决,解析类需要平台侧补充适配。分开统计,才能把工单派给正确的团队。

把健康度做成常态化机制

  1. 台账先对齐。与资产管理系统或配置管理库对账,明确"应有设备"清单,未纳管设备逐条标注原因。
  2. 每日自动采集并出健康度报表。把纳管率、采集成功率、数据新鲜度做成一张表,推送给责任人。
  3. 失败设备进待办。每条失败记录绑定责任人与处理时限,闭环后才能关闭。
  4. 新设备上线即纳管。把纳管动作写进上线流程,避免"先上线、后补录"形成新的欠账。
  5. 定期复核豁免清单。被豁免的设备要定期重新评估,签字确认后继续豁免或重新纳管。

一个容易忽略的细节:采集周期与变更窗口

采集周期设置过疏,会造成策略分析基于过期数据;设置过密,又会给设备控制面带来压力。比较稳妥的做法是按设备类型分级:核心边界设备采集更频繁,接入层设备适度放宽;同时在计划变更窗口前后各补一次采集,保证变更前后的数据都是最新的。

先把底座夯实

自动化平台的分析能力再强,也建立在数据完整的前提上。把纳管率和采集健康度做成看得见、有人跟的指标,是让平台真正发挥价值的第一步。

奇摩在实施网络自动化项目时,通常把"纳管率达标"设为一期验收的硬性条件,未纳管设备需逐条说明原因并给出纳管计划。若您需要一份纳管健康度检查表,欢迎预约咨询