结论先行:全链路监测每天产生的数据量极大,全部按最高性能存储既不经济也没必要。合理的做法是按查询频率做冷热分层:近期高频查询走热存储,历史取证数据转冷存储。这样存储成本可控,故障回溯期的完整链路也保得住。

为什么不能一刀切全量存

链路数据有两个互相矛盾的诉求:日常排障要秒级查询,监管审计要长期留存。如果全部存在高性能库里,成本会随业务量线性甚至超线性膨胀;如果为省钱只留短期,一旦需要回溯一笔数月前的异常交易,证据早已不在。

更隐蔽的问题是采样。为省钱统一低采样,恰恰会丢掉偶发故障那 1% 的异常请求;而全量高采样又撑爆存储。分层存储与动态采样配合,才能兼顾。

冷热分层的落地思路

时序指标、实时拓扑等需要高频查询的数据放热存储;全量链路明细和日志按时间窗口转移到成本更低的列式或对象存储,仍保留按需检索能力。关键是冷热之间要有自动流转策略,不必人工搬数据。

对于合规要求长期留存的交易链路,可设定独立的归档周期,把满足审计回溯要求的记录单独留存,与日常排障的热数据分离管理。

成本与取证如何兼得

分层之后,日常 80% 的查询命中热数据,体验不变;历史数据以低成本承载,存储账单显著下降。当出现需要取证的场景,冷数据仍可回查,不会因为省钱而丢失证据。

落地时建议先测算三类量:日链路条数、单条平均大小、查询并发,再据此决定热层容量与冷层周期。奇摩在金融、政企的可观测项目中积累了成熟的分层实践经验,如需结合业务量做容量规划,可 预约咨询