公司动态

AI数据中心基础设施实战:容量规划、UPS电池与监控运维

📅 2026/8/28 17:04:08
AI数据中心基础设施实战:容量规划、UPS电池与监控运维
OpenAI 数据中心负责人 Chris Malone 离职的消息传开后很多人第一反应是“高管又走了”但我更关注的是它背后暴露出的问题AI 大模型训练与推理对数据中心基础设施的依赖已经到了前所未有的程度。算力、电力、散热、网络这些基础设施的可靠性直接决定了模型能不能按时训练完、服务能不能稳定对外提供。本文不打算过多评论人事变动而是结合数据中心基础设施工程的实际场景系统梳理从容量规划、电池容量计算到监控告警、故障排查的完整技术链路。无论你是刚接触数据中心的新手还是负责机房运维的工程师都可以把这篇文章当作一份能直接参考的实操笔记。1. 背景与核心概念1.1 为什么数据中心成了 AI 时代的“兵家必争之地”先看一个很直观的逻辑大模型参数动辄千亿甚至万亿级别训练这些模型需要成千上万张 GPU 显卡同时工作。GPU 的功耗比普通 CPU 高很多一张旗舰级 GPU 的功耗可能达到 300W 到 700W一个机柜如果部署 8 张甚至更多 GPU功率密度会轻松超过 20kW 到 40kW。而传统企业机房的机柜功率密度通常只有 4kW 到 8kW。这个数字差距意味着什么供电系统要重新设计否则电不够用。散热系统要重新设计否则 GPU 过热降频训练速度大打折扣。网络架构要重新设计否则 GPU 之间通信延迟过高分布式训练效率极低。机房空间布局要重新设计否则高密度机柜的承重、散热、布线都会出问题。所以OpenAI 这类公司对数据中心负责人的依赖非常强。数据中心负责人本质上是在管理一个“物理世界的算力底座”这个人要懂电力、懂暖通、懂网络、懂供应链还要能在芯片短缺、电力紧张的大环境下保证算力按期交付。1.2 数据中心基础设施包括哪些部分数据中心基础设施可以拆成几个关键子系统子系统主要职责典型设备供配电系统将市电转换为 IT 设备可用的稳定电力变压器、UPS、PDU、柴油发电机、电池组制冷系统控制机房温度和湿度CRAC、CRAH、精密空调、液冷系统、冷/热通道网络系统连接服务器、存储和外部网络交换机、路由器、光模块、光纤布线监控系统实时监测设备状态和环境参数动环监控、传感器、BMS、告警平台消防系统保障机房安全烟雾探测器、气体灭火系统对于 AI 数据中心来说供配电和制冷系统是最核心的两个部分。原因是高密度算力设备对电力和散热极度敏感任何一个环节出问题都可能造成训练任务中断。1.3 数据中心等级标准在规划数据中心时通常用 Tier 等级来衡量可用性Tier I单路供电和单路冷却可用性约 99.671%允许计划内停机。Tier II冗余的容量组件可用性约 99.741%允许计划内停机。Tier III支持并行维护可用性约 99.982%允许计划内停机。Tier IV容错架构可用性约 99.995%任何计划内操作都不影响 IT 负载。AI 训练任务一旦中断恢复成本很高所以越来越多的 AI 数据中心按 Tier III 或 Tier IV 标准建设。当然等级越高建设成本和运维成本也越高需要根据业务场景权衡。2. 数据中心容量规划实战2.1 容量规划的目标容量规划是数据中心建设和扩容的第一步。目标很简单在满足业务需求的前提下尽量降低建设成本和运营成本。做容量规划时最核心的数据是 IT 负载总功率它会直接影响配电系统、制冷系统、UPS 和电池的选型。容量规划的基本流程统计业务需求确定服务器、GPU、存储、网络设备的数量。估算单设备功耗以 GPU 服务器为例要看额定功耗和实际运行功耗。计算 IT 总负载所有设备功耗相加并考虑冗余。推导配电容量根据 IT 负载和 PUE 推算总输入电力。推导制冷容量根据总发热量选择制冷设备。设计 UPS 和电池确定备电时间和电池容量。2.2 核心术语PUE、IT 负载、冗余PUEPower Usage Effectiveness是衡量数据中心能效的核心指标PUE 数据中心总用电量 / IT 设备用电量PUE 越接近 1说明电力越多的被 IT 设备使用基础设施损耗越小。传统数据中心的 PUE 通常在 1.5 到 2.0 之间优化较好的数据中心可以做到 1.2 左右。IT 负载指的是服务器、存储、网络设备消耗的功率制冷、照明、供配电损耗不计入 IT 负载。冗余是可靠性设计的关键概念N满足业务所需的基本设备数量。N1基本数量加上一个备用设备任何一台设备故障不影响运行。2N两套完全独立的系统任何一套故障都由另一套接管。2.3 容量规划计算示例用一个具体例子来说明。假设我们要建设一个小型 AI 训练机房计划部署 10 台 GPU 服务器每台服务器额定功耗 3000W实际运行功耗按额定功耗的 85% 估算。第一步计算 IT 负载总功率总 IT 负载 10 × 3000W × 0.85 25500W 25.5kW加上网络设备、存储设备等约 2kWIT 总负载约 27.5kW。第二步根据目标 PUE 推算总输入电力。假设目标 PUE 为 1.4数据中心总用电 27.5kW × 1.4 38.5kW这个值决定了市电引入容量和柴油发电机的功率。第三步考虑输电损耗和预留余量一般额外预留 20% 的余量设计容量 38.5kW × 1.2 46.2kW因此主供电线路至少按 50kW 设计。2.4 数据中心造价的大致构成很多刚接触数据中心的人会问建设一个数据中心到底要花多少钱数据中心造价清单通常包括以下部分土建与装修机房地板、隔断、墙面、防水等。供配电系统变压器、UPS、配电柜、线缆、电池组。制冷系统精密空调、冷水机组、管道、冷却塔。网络系统交换机、光纤、布线。监控系统动环监控、摄像头、门禁。消防系统气体灭火、烟感、温感。具体造价因地区、规模、等级不同差异很大而且涉及市场价格波动这里不能给出固定数字。但在做预算时可以参考一个经验规律供配电和制冷系统的成本通常占到基础设施总成本的 60% 以上。尤其是电池组和 UPS在 Tier III 以上等级的数据中心中占比非常高。3. 电池容量计算与 UPS 配置3.1 UPS 的作用与电池备电时间UPS不间断电源是数据中心的最后一道电力防线。市电正常时UPS 给负载供电并给电池充电市电中断时UPS 立即切换到电池供电保障 IT 设备持续运行。电池备电时间直接决定了数据中心在断电后能坚持多久。常见的备电时间设计有15 分钟仅够做到安全关机。30 分钟够执行常规停机流程。60 分钟以上配合柴油发电机启动实现无缝切换。在 AI 数据中心训练任务重、恢复成本高通常要求备电时间覆盖柴油发电机的启动时间一般建议 30 到 60 分钟。3.2 电池容量计算公式电池容量的单位是安时Ah表示电池以某个电流放电可持续的时间。计算电池容量的简化公式如下电池容量(Ah) (负载功率(W) × 备电时间(h)) / (电池电压(V) × 逆变效率 × 放电深度)公式中各参数含义负载功率UPS 需要带载的 IT 设备总功率。备电时间要求电池独立供电的时间比如 0.5 小时。电池电压电池组的直流母线电压常见的有 192V、240V、384V 等。逆变效率UPS 将直流电转换为交流电的效率通常取 0.9 到 0.95。放电深度电池放电的百分比。铅酸电池通常取 0.5 到 0.7锂电池可取 0.8 到 0.9。需要注意这是一个工程估算公式。实际选型时还要考虑电池温度系数、老化系数、放电倍率等因素最好由 UPS 厂家的选型软件出具方案。3.3 电池容量计算 Python 示例下面用 Python 写一个简单的计算脚本方便你直接修改参数使用。# 文件路径battery_capacity.py def calc_battery_capacity( load_watts: float, backup_hours: float, battery_voltage: float, inverter_efficiency: float 0.92, depth_of_discharge: float 0.7, ) - float: 计算电池容量Ah 参数说明 - load_watts: 负载功率单位 W - backup_hours: 备电时间单位 h - battery_voltage: 电池组电压单位 V - inverter_efficiency: UPS 逆变效率默认 0.92 - depth_of_discharge: 放电深度默认 0.7 capacity (load_watts * backup_hours) / ( battery_voltage * inverter_efficiency * depth_of_discharge ) return capacity if __name__ __main__: it_load 27500 # IT 负载 27.5kW backup_time 0.5 # 备电 30 分钟 battery_voltage 384 # 电池组电压 384V inverter_eff 0.92 dod 0.7 result calc_battery_capacity( load_wattsit_load, backup_hoursbackup_time, battery_voltagebattery_voltage, inverter_efficiencyinverter_eff, depth_of_dischargedod, ) print(fIT 负载: {it_load} W) print(f备电时间: {backup_time} h) print(f电池组电压: {battery_voltage} V) print(f估算电池容量: {result:.2f} Ah)运行结果IT 负载: 27500 W 备电时间: 0.5 h 电池组电压: 384 V 估算电池容量: 55.86 Ah如果选用单节 12V 100Ah 的电池并联数量为并联组数 55.86 / 100 ≈ 1实际工程中为了留有余量一般会按计算结果的 1.2 到 1.5 倍选型同时确认电池组的总电压配置是否匹配 UPS 的直流母线电压。import math battery_ah 100 # 单节电池容量 parallel_groups math.ceil(result / battery_ah) series_count battery_voltage / 12 # 假设每节 12V print(f12V 电池串联数量: {int(series_count)} 节) print(f并联组数建议: {parallel_groups} 组)这个计算思路适用于容量估算实际采购时还需要考虑峰值功率、电池寿命和运维成本。4. 制冷系统设计与散热优化4.1 风冷与液冷高密度 GPU 机柜的散热是 AI 数据中心最头疼的问题之一。传统风冷方案通过精密空调将冷风送入机房经过冷通道、设备、热通道再回收热量。风冷方案成熟可靠但当单机柜功率密度超过 20kW 时风冷的效果就会大幅下降。液冷方案是将冷却液直接或间接与服务器热源接触带走热量。液冷又分为冷板式液冷和浸没式液冷冷板式液冷冷却液在 GPU 上方的冷板中循环通过热交换器将热量传递给冷却水系统。改动相对较小是目前 AI 数据中心的主流方案。浸没式液冷将整台服务器浸泡在绝缘冷却液中散热效率最高但改造成本大运维方式不同。选择合适的散热方案需要综合考虑功耗密度、机房结构、预算和运维能力。4.2 冷通道与热通道隔离无论风冷还是液冷机房气流组织都非常重要。最常见的做法是冷通道和热通道隔离------------------------------------ | 冷通道 C | 热通道 H | | | | | [服务器] [服务器] | [服务器] [服务器]| | [服务器] [服务器] | [服务器] [服务器]| ------------------------------------服务器前侧面向冷通道吸入冷风后侧面向热通道排出热风。冷通道和热通道之间用挡板或天窗隔开避免冷热气流混合。这样做的好处是提高制冷效率。避免局部热点。可以适当提高空调回风温度降低能耗。4.3 制冷容量估算制冷系统的容量一般按 IT 设备发热量换算。IT 设备消耗的电能几乎全部转化为热量所以发热量(kW) ≈ IT 负载功率(kW)加上建筑围护结构传热、照明、人员等负荷总制冷负荷略大于 IT 负载。空调的制冷量必须大于总制冷负荷并预留 10% 到 20% 余量。用刚才的例子IT 负载 27.5kW总制冷负荷按 32kW 估算选择单台制冷量 38kW 的精密空调按 N1 配置需要两台互为冗余。5. 监控告警与运维实践5.1 监控什么数据中心监控的核心目标是提前发现风险缩短故障定位时间。监控对象分为两类环境监控温度、湿度、漏水、烟雾、粉尘。设备监控UPS 状态、电池电压、配电柜电流、空调运行状态、柴油发电机状态。对于 AI 数据中心GPU 服务器的功耗波动很大训练任务跑起来时功率飙升监控系统必须能捕捉到短时间内的功率变化所以采集频率不能太低。5.2 使用 Prometheus SNMP 监控基础设施以开源监控方案 Prometheus 为例可以用 snmp_exporter 采集 UPS、PDU、空调等设备的 SNMP 数据。# 文件路径prometheus.yml global: scrape_interval: 15s evaluation_interval: 15s scrape_configs: - job_name: ups static_configs: - targets: [192.168.1.100] metrics_path: /snmp params: auth: [public_v2] module: [ups] relabel_configs: - source_labels: [__address__] target_label: __param_target - source_labels: [__param_target] target_label: instance - target_label: __address__ replacement: 127.0.0.1:9116 - job_name: node static_configs: - targets: [192.168.1.10:9100]# 文件路径snmp.yml 中 UPS 模块的简化示例 auths: public_v2: community: public security_level: noAuthNoPriv auth_protocol: MD5 priv_protocol: DES version: 2 modules: ups: walk: - 1.3.6.1.2.1.33.1 # UPS MIB 根节点 metrics: - name: upsSecondsOnBattery oid: 1.3.6.1.2.1.33.1.2.1.0 type: gauge help: UPS 电池供电时间秒 - name: upsEstimatedChargeRemaining oid: 1.3.6.1.2.1.33.1.2.4.0 type: gauge help: UPS 剩余电量百分比这里需要说明的是不同厂商 UPS 的 OID 可能不同具体要参考设备自带的 MIB 文件。snmp_exporter 可以通过snmp_exporter -config.filesnmp.yml启动然后在 Prometheus 的配置中定义对应的采集任务。5.3 使用 ipmitool 查看服务器功耗对于支持 IPMI 的服务器可以用 ipmitool 直接读取功耗信息。# 查看服务器功耗 ipmitool -I lanplus -H 192.168.1.10 -U admin -P password dcmi power reading执行结果类似Instantaneous power reading: 320 Watts Minimum during sampling period: 280 Watts Maximum during sampling period: 360 Watts Average during sampling period: 310 Watts注意-H后面的 IP、用户名和密码要根据实际环境修改。生产环境中不要使用弱密码并尽量通过带外管理网络访问。5.4 告警阈值设计告警不是越多越好而是要设计合理的阈值避免告警风暴。参考建议监控项警告阈值严重阈值机柜温度28°C35°C机柜湿度40% - 60% 之外30% - 70% 之外UPS 剩余电量低于 60%低于 30%UPS 负载率高于 70%高于 85%空调出风温度高于 18°C高于 24°C电池电压偏差单节偏差 5%单节偏差 10%阈值需要根据设备实际规格和业务容忍度调整。比如 GPU 服务器的进风温度要求可能比普通服务器严格建议参考设备厂商的技术白皮书。6. 常见问题与排查思路数据中心运维中会遇到各种各样的问题下面按故障现象整理一份常见排查表格。问题现象常见原因排查思路与解决方案UPS 频繁切到电池供电市电波动、UPS 输入电压范围设置过窄检查输入电压记录调整 UPS 输入电压窗口确认市电质量必要时增加稳压设备电池备电时间变短电池老化、某节电池故障、充电不足使用电池巡检仪逐节测量电压和内阻对故障电池进行更换定期做放电测试机柜出现局部热点冷热通道未隔离、空调送风量不足、机柜负载过高检查通道密封性调整空调送风温度增加盲板优化设备布局空调制冷量不足制冷剂泄漏、过滤器堵塞、冷凝器脏污检查制冷剂压力、清洗过滤器、清理冷凝器翅片服务器功耗波动导致跳闸单路 PDU 超载、断路器规格偏小统计各 PDU 电流重新分配负载按峰值功率而非额定功率选型断路器监控平台收不到设备数据SNMP 团体名错误、网络不通、设备 SNMP 未开启用 snmpwalk 测试连通性核对团体名、版本、OID柴油发电机启动失败蓄电池亏电、燃油不足、控制系统故障定期检查启动电池和燃油油位每月进行空载测试每季度进行带载测试6.1 电池放电测试注意事项电池放电测试是发现电池隐患的有效手段但也存在风险。测试时需要注意确认 UPS 负载在安全范围内测试过程中如果市电中断电池可能无法支持备电时间。选择业务低峰期进行。提前通知业务团队做好应急响应准备。测试过程中持续监控电池电压、电流和温度。发现异常立即停止测试切回市电供电。6.2 排查配电系统故障的通用步骤当机房出现大面积掉电时不要盲目合闸下面是一套保守的排查顺序确认市电输入是否正常。确认柴油发电机是否启动并稳定带载。确认 UPS 是否切换成功电池是否供电。检查配电柜内断路器是否跳闸。检查 PDU 是否负载过高。确认服务器和网络设备是否恢复运行。整个过程中维修操作必须由具备资质的电工执行普通开发人员和运维人员不要擅自打开配电柜。7. 最佳实践与工程建议7.1 容量规划要留有余地AI 业务增长很快模型参数量和训练频次都可能快速变化。容量规划时不要卡着冗余刚好够用建议在可承受范围内适当增加余量。基础设施扩容比软件扩容慢得多一旦电力、制冷、空间不足可能需要几个月甚至一年的改造周期。7.2 电池组维护要建立台账电池是数据中心最容易“突然死亡”的部件。建议为每一组电池建立维护台账记录安装时间、品牌型号、测试记录、异常事件。铅酸电池寿命通常 3 到 5 年锂电池寿命更长但也要定期检查管理系统。7.3 监控采集与告警要分环境生产环境和非生产环境的监控策略要分开。测试机房的告警阈值可以放宽生产机房必须严格控制。同时告警通知要有分级机制避免所有问题都通过同一渠道发送导致高优先级告警被淹没。7.4 关注可持续性与能效AI 数据中心的能耗问题越来越受关注。工程上的优化方向包括提高机房送风温度减少制冷能耗。使用变频空调让制冷量跟随负载变化。使用液冷方案提升散热效率。优化 PUE定期审查用电数据。这些措施既能降低运营成本也能减少环境影响。7.5 做好变更管理数据中心任何操作都伴随风险。UPS 切换、配电柜改造、空调停机维护都应该走变更流程提交变更申请说明变更内容和影响范围。评估风险制定回滚方案。在业务低峰期执行。操作过程中安排专人监控。变更后观察一段时间再确认闭环。7.6 安全与权限控制数据中心物理安全和逻辑安全同样重要机房进出需要严格的权限审批和记录。监控系统账号使用强密码定期轮换。动环监控平台的 API 和管理接口不要暴露到公网。数据库、配置文件的备份要加密保存。8. 总结回到 OpenAI 数据中心负责人离职这件事。高管的变动确实会影响公司战略的执行节奏但数据中心基础设施的底层技术逻辑不会改变供电要可靠制冷要匹配网络要稳定监控要实时运维要规范。无论谁在负责AI 对算力基础设施的需求都在持续增长懂电力、懂散热、懂监控、懂运维的工程师永远不会缺机会。如果你正在规划一个小型 AI 训练机房可以顺着这篇文章的思路先从容量规划开始算出 IT 负载再推导配电和制冷需求接着设计 UPS 和电池方案最后搭一套基础的监控告警系统。技术细节很多但只要把架构理清楚后续的问题就能一个个拆解。动手算一次容量排查一次真实故障比看十篇文章都管用。