功率提高一个量级,整套基础设施都要重算
25 年前,数据中心的典型机架功率约 5kW;如今单机架已可超过 100kW,未来部分机架或超过 1MW。一次跳变来自通用服务器的密度提升,另一次来自 GPU 训练集群整机上架。功率提高一个量级之后,供电容量、制冷方式与楼板承重会同时失效,运维团队面对的是整套基础设施重算。
英伟达在 Blackwell 上已大量采用液冷;到 Vera Rubin 一代,AI 基础设施做到 100% 液冷,系统不含任何风扇。散热因此不再是机房的配套项,而是成本表里单独的一行。
液冷带出的检测与控制清单
冷板液冷需要持续采集的量至少有五类:冷板温度、冷却液进出口温度、压力、流量、液位,外加漏液状态与泵阀电机转速。每一类都要有传感器、信号链与驱动电路。
| 采集对象 | 运维关注点 | 器件侧动作 |
|---|---|---|
| 冷板与冷却液温度 | 控制环路是否稳 | 据 ADI 2026 年发布,ADT7604 提供 20 路单端或 10 路差分输入、测温精度 0.1℃ |
| 压力与流量 | 堵塞与流量衰减 | 泵阀电机驱动与信号链同步升级 |
| 液位与漏液 | 漏液即停机风险 | 漏液检测与闭环控制联动 |
奇摩在数据中心运维可视化项目上看到的共性问题是:温度与功率的采集点往往在扩容之后才补,闭环控制因此拿不到历史基线。
超节点把液冷推到系统级
据华为 2026 年全联接大会上的发布,昇腾 960 超节点采用正交架构与全液冷设计,通过 4096 卡高速互联,RTT 时延低至 2 微秒,HBM 容量上限 1PB。系统层面用 5500 个 Hi-ONE 光引擎替代约 4.8 万颗 800G 可插拔光模块,功耗降低超过 550 千瓦,可用度达到 99.8%,多个超节点互联后可扩展至 100 万卡集群。
可靠性与采购:两笔要先算的账
液冷系统的故障模式与风冷不同,漏液、泵失效、控制环路失稳都可能造成停机。意法半导体称,冷却系统至多可占 AI 数据中心能源成本的 40%。据 SIA 2026 年的数据,7 月全球半导体销售额 1468 亿美元,环比增长 6.4%,景气沿五个环节扩散,电源与散热、高速连接都在其中。
供给侧的价格信号同样明显。据平台用户流传的定价信息,Nebius 将自 10 月 1 日起上调 GPU 云服务价格,平均涨幅约 20%,H100 由 3.85 美元升至 4.50 美元每 GPU·小时。据央视财经 2026 年援引的行业调研,国内 AI 芯片需求约 400 万颗,实际交付约 300 万颗。奇摩在容灾与数据中台项目上的经验是:把供电与制冷余量写进续约谈判,比事后扩容划算。
奇摩在基础设施运维上的做法是先立功率与温度基线,再谈扩容与改造;顺序反过来,投资容易重复。进一步了解相关方案,可查看 WorkBuddy 解决方案。
