结论先行:网络自动化平台的价值建立在"纳管得全、采得准"之上。纳管率不到百分之百时,路径计算会漏算途经设备、存量策略治理会漏掉未纳管设备的风险规则、应急封堵会留下死角。可行做法是把纳管率和采集健康度当成一级运营指标:先定义口径与基线,再按失败原因分三类处理(认证类、连通类、解析类),最后把健康度巡检固化成周任务并绑定责任人。
纳管不全的三个直接后果
| 使用场景 | 纳管缺失的影响 | 典型表现 |
|---|---|---|
| 路径计算与策略下发 | 漏算途经设备,配置不完整 | 业务开通后仍不通,反复返工提单 |
| 存量策略治理 | 部分设备的僵尸策略与宽泛策略扫不到 | 治理报告看起来干净,审计时仍被查出高危规则 |
| 应急封堵 | 部分边界设备未收到黑名单 | 封堵演练报成功,实际仍有链路未覆盖 |
这三件事的共同点是:平台输出的结果看起来是成功的,但覆盖面存在缺口。因此纳管率必须是持续跟踪的指标,而不是上线时检查一次。
先定口径:三项指标怎么算
| 指标 | 计算口径 | 基线建议 | 告警阈值 |
|---|---|---|---|
| 纳管率 | 已纳管设备数 ÷ 资产台账内应有设备数 | 生产网核心与边界设备百分之百 | 低于基线即告警 |
| 采集成功率 | 周期内成功采集次数 ÷ 应采集次数 | 按设备类型分别设定 | 连续两个周期失败即告警 |
| 数据新鲜度 | 当前时间 − 最近一次成功采集时间 | 不超过一个采集周期的两倍 | 超时即标记为待处理 |
口径要和业务方对齐:哪些设备在范围内、哪些是测试环境、哪些是已申请豁免的存量设备。口径不清,指标再好看也没有意义。
三类失败原因与处理办法
| 类别 | 典型原因 | 排查动作 | 常见责任方 |
|---|---|---|---|
| 认证类 | 账号权限不足、认证方式变更、口令过期 | 用平台账号手工登录验证,核对权限级别 | 安全与账号管理 |
| 连通类 | 管理口不可达、中间策略限制、连接超时 | 从平台侧做连通性测试,核对管理网段策略 | 网络运维 |
| 解析类 | 命令回显格式变化、版本升级后语法差异、长回显被截断 | 抓取原始回显与解析模板比对,补充适配 | 平台实施 |
三类原因的处理成本差别很大:认证类和连通类通常在运维侧就能解决,解析类需要平台侧补充适配。分开统计,才能把工单派给正确的团队。
把健康度做成常态化机制
- 台账先对齐。与资产管理系统或配置管理库对账,明确"应有设备"清单,未纳管设备逐条标注原因。
- 每日自动采集并出健康度报表。把纳管率、采集成功率、数据新鲜度做成一张表,推送给责任人。
- 失败设备进待办。每条失败记录绑定责任人与处理时限,闭环后才能关闭。
- 新设备上线即纳管。把纳管动作写进上线流程,避免"先上线、后补录"形成新的欠账。
- 定期复核豁免清单。被豁免的设备要定期重新评估,签字确认后继续豁免或重新纳管。
一个容易忽略的细节:采集周期与变更窗口
采集周期设置过疏,会造成策略分析基于过期数据;设置过密,又会给设备控制面带来压力。比较稳妥的做法是按设备类型分级:核心边界设备采集更频繁,接入层设备适度放宽;同时在计划变更窗口前后各补一次采集,保证变更前后的数据都是最新的。
先把底座夯实
自动化平台的分析能力再强,也建立在数据完整的前提上。把纳管率和采集健康度做成看得见、有人跟的指标,是让平台真正发挥价值的第一步。
奇摩在实施网络自动化项目时,通常把"纳管率达标"设为一期验收的硬性条件,未纳管设备需逐条说明原因并给出纳管计划。若您需要一份纳管健康度检查表,欢迎预约咨询。
