简介:为什么制冷在数据中心至关重要

现代数据中心充当全球数字基础设施的核心,每秒处理数十亿个请求。每个处理器在运行过程中都会产生高温,不受控制的累积可以使设备寿命缩短高达 50%,并导致灾难性故障。

高效冷却不仅仅是舒适的问题,而且保持服务可用性是必不可少的,单次热故障会击倒整个服务器,造成数百万美元的损失。

热挑战:功率密度和散热

1个典型的数据中心,将成百上千台服务器集中于缩小的空间,高性能服务器可以产生500至1500瓦的热量,而整个房间可以达到每平方米10至20千瓦的密度。

Intel Xeon 和 AMD EPYC 等现代处理器需要在 60 °C 至 80 °C 之间运行,以保持最大性能。克服 90 °C 会激活节流机制,降低处理器速度并影响整个数据中心吞吐量。在极端情况下,高于 100 °C,会自动关闭以保护。

不当耗散也会推高运营成本。环境温度每升高 5 °C,冷却功耗就会增加约 10%,从而形成影响提供商利润率的恶性循环。

传统空气冷却系统(CRAC/CRAH)

CRAC(电脑室空调) e CRAH(计算机室空气处理机) 它们的工作原理是使用热通道/冷通道等设置在热气流和冷气流之间建立物理隔离。

式(热通道/冷通道结构)中,服务器是交替排列的:一排前面面向冷通道(冷却空气循环的地方),下一排后面面向热通道(捕获加热空气的地方),这样可以最大限度地减少空气混合并最大限度地提高效率。

然而,这些系统存在局限性。它们消耗的能量占数据中心总能量的40%至50%,并且难以处理超高处理器密度。

液体冷却:高性能解决方案

液体冷却 液(蒸馏水、专用冷却剂或低粘度油)代替空气直接通过连接到处理器的管子循环,从而更有效地吸收热量。

主要有两种方法:

  • 直接液体冷却(直接芯片):管道直接连接到处理器,在原点处远程加热。与空气相比,温度降低 10 至 20 °C。
  • 浸泡:整台服务器都浸没在电力的非导电流体中,允许密度高达每平方米50千瓦,比传统空气高3至5倍。

Meta、谷歌和微软等巨头已经在数据中心产品组合中实施了浸入式冷却。流体吸收了硬件‘处理器、GPU、内存、电源和’DO的所有热量,从而消除了内部风扇的需求,并减少了高达40%的能耗。

先进的热耗散技术

热管酒店 e 热扩散器 热管是一种密封的铜管,含有特殊流体,在液相和蒸气之间变化,极为有效地输送热量。

铜和铝吊具 它们增加了处理器的接触面积,将热量分布在更大的体积中。现代处理器使用高效导电热膏(带有银或石墨烯颗粒)在芯片和撒布器之间施加,确保最大程度的传热。

制冷 免费冷却 是另一项策略:在环境温度较低的时期(夜间、冬季),自然室外空气为散热器供电,而无需使用空调压缩机,寒冷地区(芬兰、冰岛、挪威)的大型数据中心利用这一点,在一年中的大部分时间里将成本降低60%至80%。

实时监控和自动化

现代热管理系统使用分散在每个服务器和走廊的数百个传感器,这些传感器连续测量温度、相对湿度和气流,将数据发送到动态调整风扇和压缩机速度的 AI 平台。

机器学习算法可以预测负载峰值并在达到临界温度之前增加冷却能力。这可以防止处理器节流并确保在最大性能下恒定运行。一些数据中心也使用 热点检测酒店:如果特定区域达到85 °C,系统会自动将处理负载重新分配给附近的较冷服务器。

冗余是强制性的'冷却系统的故障不能导致数据中心瘫痪。因此,多个CRAC单元、冷却塔和带有发电机的备用系统并行工作。任何发生故障的单元都会自动停用,其负载分布在运行单元之间。

效率指标:PUE 和成本节约

PUE(电源使用效果) 是数据中心总功耗与IT设备消耗之间的标准公制:比率,理想的PUE为1.0(每焦耳到IT),在实践中,现代数据中心达到1.2至1.4μ,这意味着服务器上每100瓦,就有20至40瓦用于冷却、照明和分配。

Google 在其最高效的数据中心将 PUE 降低至 1.08,采用液体冷却、自由冷却和 AI 相结合。Meta 报告最近安装的 PUE 从 1.1 降至 1.13。PUE 的每减少 0.1 次,每年可为运行数百兆瓦的运营商节省数百万美元的电力。

能源成本占数据中心运营费用的 30% 至 40%。因此,优化冷却是盈利的最大杠杆。投资先进系统最初的成本更高(浸入式冷却改造每次安装的成本可能为 2-500 万美元),但 3-5 年后回报是有保证的。