一、算力产业进入“整机柜”时代
去年9月18日,华为全联接大会在上海发布昇腾960超节点,卡规模拓展至15488张昇腾卡。与此同时,中科曙光十万卡液冷集群“曙光8000(登峰)”采用相变浸没液冷技术,PUE值降至1.04以下,单机柜功率密度突破900kW。国家数据局数据显示,截至2026年7月底,全国智算总规模达245万PFLOPS(FP16),已有145万PFLOPS智能算力纳入监测调度平台。
算力基础设施的规模化跃进,正在重塑AI服务器的产品形态:从单机走向整机柜,从风冷走向液冷。一台搭载8块GPU的主流AI服务器,峰值功耗轻松突破10kW,42U标准机柜加上液冷管路和电源分配单元,整体尺寸远超常规试验箱的容纳范围。整机柜级可靠性验证,已从“可选项”变为“必选项” 。GB/T 2423.2-2008明确规定,服务器高温测试温度需达到55℃至85℃,测试时长不低于16小时。而YD/T 6361-2025《云数据中心服务器机柜测试方法》进一步将整机柜产品可靠性测试纳入行业规范。
二、整机柜测试的三道难题
难题一:尺寸——装不进去,一切都是空谈。 标准42U服务器机柜尺寸为高2000mm×宽600mm×深1200mm,带设备总重量超过800kg。常规环境试验箱的内容积通常在数百升量级,根本容不下整柜系统。若采用拆解测试,将服务器从机柜中取出后分别测试,则无法模拟整柜装配后的真实热环境与系统配合情况,测试结果不能反映整机的真实可靠性。
难题二:发热——设备自身就是“热源”。 与被动受热的传统元器件不同,AI服务器在测试过程中处于满负载运行状态,机柜自身发热功率不低于30kW,瞬时热流密度可达传统服务器的3至5倍。当硬件工作温度触及85℃至90℃的临界**阈值时,GPU会自动启动热节流程序,运行效率下滑高达25%。这意味着试验箱不仅要按程序改变环境温度,还必须实时抵消设备自身持续产出的数十千瓦热量。
难题三:液冷——带液运行,密封是关键。 液冷AI服务器在测试过程中需要保持冷却液正常循环,试验箱必须预留液冷管路穿墙接口,接口需密封可靠,不能出现冷桥结露或漏风影响温场。这对试验箱的密封设计、管路布局和防凝露控制提出了远超常规环境试验设备的要求。
三、传统试验设备的力不从心
传统步入式高低温试验箱在设计之初主要面向低发热或无发热试件,制冷能力普遍低于10kW,面对30kW的持续发热根本无法将箱内温度降至设定值。更为关键的是,部分厂商标称的温变速率是空载状态下的最大值,一旦放入满负载运行的高功耗设备,实际速率可能骤降至标称值的几分之一,测试数据严重失真。
此外,传统试验箱不具备液冷管路穿墙接口,无法完成带液运行测试。如果将整柜送至第三方检测机构,不仅费用高昂、排队长达一个多月,还存在新产品技术方案泄露的风险。
四、宏展Walk-in步入式方案:关键参数与技术能力
广东宏展科技(Lab Companion)位于广东省东莞市,在东莞、昆山、重庆设有三大研发制造工厂,专注环境与可靠性试验设备研发制造二十余年。针对AI算力整机柜测试需求推出的高发热大负载Walk-in步入式快温变试验箱,围绕上述三道难题给出了系统性回答。
应对尺寸难题: CW2000型设备内部净尺寸为宽1500mm×深2000mm×高2200mm,内容积2000L,可轻松容纳标准42U服务器机柜。箱底采用10号槽钢焊接框架,铺设5mm厚花纹钢板,额定承重1500kg。设备采用双开门设计,开门宽度1400mm、高度2100mm,机柜可直接水平推入,无需拆解或倾斜。容积覆盖1000L至10000L,可依据客户需求进行更大尺寸的非标拓展。
应对发热难题: 设备采用二元复叠制冷系统,额定制冷量60kW,标准机型可同时带载1000kg铝锭与50kW被测件自发热。在满载条件下,+100℃→0℃平均降温速率为5K/min,0℃→+100℃平均升温速率为5K/min,所有速率均为满载实测值而非空载标称值。控温精度方面,温度波动性≤1.0K,温度均匀性≤2.0K,温度偏差±2.0K。技术路径上采用间接制冷系统配合上送风、下回风闭式循环风道,箱体两侧或后部布置多个可调式出风口,配合多点PID同步调节与分区补偿控制策略,有效避免大空间高负载工况下的气流死角与局部过热。
应对液冷难题: 设备可定制液冷管路穿墙密封接口,支持将外部CDU(冷量分配单元)的供回液管路引入箱内,在温度循环测试过程中保持液冷系统正常循环。箱内设置的积液检测与报警装置可及时发现泄漏风险,确保带液测试的稳定性与温场稳定性。
五、从单柜到集群:测试体系的延伸
整机柜测试能力的建立,并非单一设备参数的简单叠加,而是从芯片级到整柜级测试链条的系统性贯通。
国内某头部AI服务器厂商在2026年推出新一代液冷AI服务器时,面临整柜测试的现实难题:单柜配置8颗大算力GPU,采用冷板式液冷散热,满负载运行时机柜总功耗超过30kW。宏展科技为该客户提供了定制化方案,配套至少20路温度采集通道,可同时监控GPU、冷板、进出水口等关键位置温度,所有数据自动记录、不可篡改。该方案配合客户完成了总计300小时的连续可靠性测试,覆盖高温高湿、低温存储、温度循环三个阶段,一次性通过所有测试项目。
从测试体系的角度看,Walk-in步入式快温变试验箱的价值不仅在于承载单个42U机柜的验证需求。随着算力集群从数十柜向数百柜、数千柜扩展,整机柜可靠性验证的批量化和标准化将成为新的工程课题。宏展科技正在将整柜测试方案向集群级测试场景延伸,为算力基础设施企业提供从单柜验证到批量测试的体系化能力。
六、交付前的最后一道验证
当算力产业从“万卡时代”迈入“十万卡时代”,每一台出厂的AI服务器整机柜都承载着数据中心稳定运行的期望。整机柜级可靠性验证,是产品交付客户前的最后一道防线,也是产品上市前绕不开的关键一关。
广东宏展科技Walk-in步入式快温变试验箱,以50kW热负载处理能力、1000kg机械负载承载、满载5K/min温变速率、液冷管路穿墙接口和42U整柜容纳能力,为AI服务器整机柜测试提供了从尺寸到发热、从液冷到数据的完整工程方案。在算力基础设施加速建设的当下,可靠的测试设备是产品质量的基石,也是产业健康发展的保障。