2025年是乙巳蛇年,这一年“智算”这个词几乎从产业术语变成了行业里的头号关键词。我做了十几年数据中心和云计算相关的工作,最直观的感受是:智算不是PPT里的一句口号,而是实打实的机房改造、网络升级、散热重构和运维转型。借着光环新网这一年的布局和动作,我把2025年智算行业的观察、项目实操经验以及踩过的坑一并梳理出来。这篇内容适合数据中心从业者、AI基础设施工程师、企业IT选型负责人,以及所有想搞清楚“智算中心到底怎么建、怎么用、怎么管”的朋友。
1. 2025年智算行业的关键变化:从“有没有算力”到“用得起算力”
1.1 智算形态的转变:CPU云算力转向GPU智算云
2025年最明显的一个变化,是算力需求结构发生了拐点。过去几年大家说的“云计算”,本质是以CPU为核心的通算,跑网站、数据库、微服务这些业务。但2025年这个天平明显往GPU倾斜了。智算中心里上线的不再是几十台通用服务器,而是一组组动辄几十柜、上百柜的GPU训练集群。
这个转变带来了一系列连锁反应。首先是机房形态变了,传统数据中心一个机柜8到10千瓦,放几台通用服务器绰绰有余。但到了智算时代,一台8卡GPU服务器整机功耗就在10到12千瓦,新一代的机柜级AI服务器甚至能把单柜功率推到100千瓦以上。用过去的风冷思路去做智算中心,物理上根本扛不住。这也解释了为什么2025年液冷从“可选方案”变成了“默认配置”。
1.2 训练与推理的结构性变化
2025年还有一个值得注意的转变:推理算力的需求增速开始超过训练算力。前两年大家抢购GPU主要是为了做大模型训练和调优,一个千亿参数模型一次预训练要烧掉数千张卡跑几十天。但到了2025年,大模型开始大规模进入生产环境,API调用、Agent应用、多模态生成这些推理负载呈爆发式增长。
推理负载和训练负载的差别非常大。训练任务能容忍较高的延迟,但对吞吐和稳定性要求极高;推理任务则反过来,单个请求的延迟直接决定用户体验,2秒的响应和5秒的响应,转化率差距肉眼可见。这意味着智算中心不能只做“大规模算力供给”,还得在调度层面区分训练集群和推理集群,甚至在同一个集群里做混合部署。这个趋势直接影响了我后面要讲的平台层设计。
1.3 行业格局:老IDC、云厂商、新玩家同台竞技
2025年的智算市场不再是云厂商的独角戏。像光环新网这种做数据中心起家的服务商,反而因为手上握有大量存量机房、电力资源和大客户关系,在智算转型上走得很稳。老IDC的优势在于“地”和“电”,智算中心最大的瓶颈不是芯片,而是哪里有足够的电力、哪里能快速完成机房改造。新玩家带着资金冲进来,拿不到电和地一样白搭。
当然,光有电和地也不够。智算中心运营的复杂度比传统IDC高了一个量级,GPU集群的故障率、网络拥塞、散热管理都是新课题。2025年行业里逐渐形成一个共识:智算服务商的竞争,已经从“谁建得快”转向“谁跑得稳、用得省”。
2. 智算中心的技术底座:从机房到算力集群的全面重构
2.1 电力与散热:液冷从可选变为标配
智算中心面对的散热压力,用一组数据就能说明白。传统数据中心风冷系统能把单柜8到12千瓦的热量带走,改造优化后能勉强支撑20到30千瓦。但一个GPU机柜动辄50千瓦起步,新一代NVL72这类整机柜方案直接干到120千瓦以上。风冷在这个密度下基本失效,必须上液冷。
液冷有两条技术路线:冷板式和浸没式。2025年行业里主流选择是冷板式,核心逻辑是让冷却液通过金属冷板直接贴在CPU、GPU、内存这些发热元件上,热量通过液体带走,再经过室外冷却塔或干冷器散掉。冷板式液冷对现有数据中心改造相对友好,机房不用完全重构,机柜内部加装冷板、管路和分水器就能实现。
从实际运行数据看,冷板式液冷可以把PUE从传统风冷的1.4左右压到1.15以下,全年算下来电费节省非常可观。不过液冷带来了新的运维门槛:管路接头会不会漏液、水质电导率怎么控制、冷却液分配单元的流量怎么调,这些都是2025年智算运维团队必须啃下的硬骨头。
2.2 网络组网:IB与RoCE的选型之争
算力集群的第二个核心是网络。训练一个千亿参数模型,动辄需要几百上千张GPU协同工作,每迭代一步,梯度数据都要在卡与卡之间同步一遍。网络就是整个集群的“神经系统”,带宽和时延直接决定训练效率。
2025年主流的集群组网方案仍是两大阵营:InfiniBand(IB)和RoCE(RDMA over Converged Ethernet)。IB网络性能和稳定性更好,自带无损传输机制,缺点是贵,而且是封闭生态。RoCE跑在以太网上,成本低、开放性强,但要达到不丢包,必须把流控、拥塞控制这些参数调到最优,运维复杂度高不少。
以400G网络为例,一条RoCE链路在应用ECN和PFC之后,性能可以做到接近IB的90%以上,但价格能便宜三分之一甚至更多。2025年很多智算中心为了平衡成本和性能,采用了IB和RoCE混布的方案:核心训练集群用IB,推理集群和存储网络走RoCE。选型没有绝对答案,关键看预算、业务负载和团队的技术储备。
2.3 存储与数据访问:别让I/O拖了训练后腿
智算集群的第三个隐藏瓶颈是存储。GPU算力再强,数据喂不进去就是白搭。大模型训练的样本数据动辄几十TB到几个PB,Checkpoint文件又是几百GB到几TB级别的,传统NAS的文件服务性能根本不够用。
2025年智算中心的存储架构,主流方案是并行文件系统配合高性能分布式存储。Lustre、GPFS这类老牌并行文件系统在HPC领域已经验证了十几年,现在被大量引入智算中心。核心设计思路是把数据切片分布到多个存储节点上,客户端可以并行读写,聚合带宽能做上几个GB/s到几十GB/s。
这里有个实操经验:很多团队一开始只盯着GPU和网络,忽略了存储性能,结果数据加载阶段每轮都要等很久,GPU利用率被拖到30%以下。我见过最夸张的一个案例,存储瓶颈导致整个集群训练吞吐只有理论值的四分之一。做智算项目,存储规划和GPU选型必须同时启动。
3. 从项目角度看智算中心落地:一个典型交付案例的复盘
3.1 前期规划:选址与需求对齐
2025年我深度参与了一个智算中心从规划到交付的项目,整个过程走下来有不少值得分享的细节。项目第一步不是选GPU型号,而是做需求对齐。客户到底是要跑训练还是推理、预计多少个并发任务、数据量级有多大、对延迟的容忍度是多少,这些决定了集群规模、网络方案和存储架构。
第二步是选址。智算中心对地理位置极其敏感,不是因为风水,而是因为电和网络。一个大型智算集群满载功率在10到30兆瓦,必须靠近变电站或者有独立的电力增容条件。同时要评估骨干网络接入能力,光纤距离和路由越优化,跨地域数据传输的时延就越低。
气候条件也值得考虑。虽然液冷系统对气温的敏感度比风冷低,但室外冷却设备在高温天气下的散热效率会下降。北方地区因为冬季气温低,自然冷却时间长,全年PUE普遍低于南方,这是很多智算中心选址偏北的核心原因。
3.2 模块化设计与机柜布局
智算中心规划里,模块化是个绕不开的设计思路。传统数据中心一栋楼统一规划、统一建设,周期长、灵活性差。2025年的智算项目更倾向模块化集装箱方案:以一个或几个GPU集群为单位,电力、冷却、网络都在模块内部闭环,然后按需拼接扩展。
机柜布局层面,最典型的做法是GPU机柜与冷站分开布置。GPU机柜内部按“8台GPU服务器+2台交换机+1套液冷分水器”组成一个标准单元,冷站则统一放在机房外侧,通过一次侧和二次侧管路实现热量搬运。这种布局的好处是,GPU机柜区域可以做到高密度部署,同时把运维维护的热点和噪音都隔离出去。
一个容易被忽视的细节是地板承重。GPU服务器的重量远超通用服务器,一台8卡服务器满配在100到150公斤,机柜里装满设备后总重可能接近2吨。传统数据中心的防静电地板承重标准,在高密度智算场景下基本不够用,需要在建设阶段就做好承重加固。
3.3 集群调优:从硬件上架到稳定运行
硬件上架只是开始,集群调优才是真正考验功力的阶段。我们当时从裸金属上架到系统能稳定跑一个千亿参数模型的训练任务,花了大概三周时间。这里面包括操作系统和驱动的适配、固件升级、RDMA网络的连通性测试、存储压测、分布式训练框架的配置等。
网络调优是最耗时的环节。RoCE网络场景下,光把链路连通是不够的,交换机上要开启PFC(优先级流控)和ECN(显式拥塞通知),并且把水线参数调到合理值。水线设得太激进,网络频繁进入流控状态,吞吐掉得厉害;设得太宽,丢包率上来,训练任务照样变慢。我们是通过多轮压测,找到一个在不丢包前提下能跑出最高带宽的平衡点。
这里补充一个关键经验:集群验收阶段一定要跑真实的训练负载做压测,不能只跑网络带宽测试工具。带宽测试工具显示95%的线速,不代表真实分布式训练场景下GPU利用率就能上去。集通信模式、梯度同步的burst流量特征都跟普通网络流量完全不同,只有拿真实模型跑出来的性能数据才算数。
3.4 交付阶段踩过的坑
这个项目交付过程中踩过几个值得记录的坑。第一个是机柜上电瞬间的浪涌问题。十几台GPU服务器同时上电,瞬时电流非常大,后端UPS如果配置不合理,很容易触发过载保护。我们的做法是通过带外管理平台做分批上电,每批间隔几秒,避免瞬时冲击。
第二个坑是光纤模块的兼容性问题。采购的交换机和光模块来自不同厂商,虽然有标准协议覆盖,但实际插上后偶尔出现端口协商失败或误码率高的问题。排查下来发现是部分光模块的固件版本太旧,批量升级固件后问题消失。这批模块在库存里放了大半年,生产日期都在前一年,也是触发兼容性问题的因素之一。
第三个坑来自水冷系统。冷板液冷系统在调试阶段就发现了两个接头渗水,虽然量不大,但说明管路安装环节确实存在品控风险。后来我们调整了安装流程,每个接头安装后必须用扭矩扳手二次确认,并且全部做保压测试,打完压静置24小时压力不掉才算合格。
4. 平台与应用:算力要“管得起来”才叫智算
4.1 算力调度平台:多租户场景下的关键组件
硬件集群建好之后,下一步就是算力调度平台。一个智算中心不可能只服务一个大客户跑一个训练任务,大多数场景是多租户、多任务并行。怎么把上千张GPU安全、高效、公平地分配给不同团队,这是调度平台要解决的核心问题。
2025年智算领域比较成熟的做法是基于Kubernetes做GPU虚拟化和调度增强。比如通过设备插件把物理GPU切分成MIG实例或时间片,配合队列管理实现多队列隔离。关键落在两点:一是调度策略要能感知拓扑,尽量把同一个训练任务分配到同一台物理机或同一个网络交换域内,减少跨节点通信;二是抢占策略要可控,低优先级任务遇到高优先级任务时要能优雅退出,Checkpoint机制得跟上,否则杀任务等于白烧钱。
坦白说,2025年调度平台还没有一个统一的标准答案,各家都在摸索。有开源方案,也有厂商闭源产品。我的经验是先选一个主流的开源底座,比如Kueue配合Volcano,跑顺之后再看要不要引入商业化的调度组件。
4.2 资源利用率:GPU利用率不等于赚钱
智算中心经营者的核心指标很多,但2025年大家最关注的一个词是GPU利用率。这个指标直接决定项目的投资回报周期。同样是1000张GPU的集群,利用率为80%和40%,营收相差一倍,但电费和硬件折旧成本差不多是固定的。
提升GPU利用率有两条路线。第一是调度层面的优化,把碎片化的小任务组合起来,填满空闲时隙;第二是算力切分,稳定支撑多个中小型推理任务共享同一块GPU。但GPU切分有代价,频繁的显存切换和上下文切换会引入额外开销,需要结合业务实际场景反复权衡。
另一个2025年逐渐被接受的理念是“训推混布”。白天推理任务多,晚上训练任务多,通过调度策略在时间维度上错峰使用同一批硬件。这种模式对平台层的弹性调度要求更高,但确实能显著提高硬件的使用效率。
4.3 行业应用生态:算力最终要落到业务场景
智算如果不能落地到具体业务场景,终究只是空转的机器。2025年智算应用主要集中在几个高价值行业:智能制造领域的机器视觉质检、金融领域的风控模型、医疗影像辅助诊断、自动驾驶的数据训练和仿真。这些行业普遍有大量数据积累、明确的降本增效诉求和足够的付费能力。
2025年还有一个明显的动向:很多智算中心开始做“算力+行业解决方案”的打包模式,不单纯出租算力,而是把模型微调工具链、行业数据预处理流程、模型评测体系都集成到平台上。光环新网这类服务商在推智算服务时,也明显在往产业互联网方向延伸,做一些行业SaaS的结合。这个方向在2026年应该会加速,算力服务商正在从“卖水电”走向“卖制造能力”。
5. 智算运维实录:2025年处理过的典型故障与排查思路
5.1 训练中断与断点续训的坑
2025年我处理过最频繁的故障类型就是训练任务中断。大模型训练跑几天几夜,任何一台GPU卡故障、网络闪断、存储抖动,都可能导致整个训练任务崩溃。如果不做断点续训,损失就是几十个小时的GPU时间。
断点续训的核心是Checkpoint机制。工程上常见的策略是周期性保存模型权重、优化器状态和随机数生成器状态,保存频率通常设置为每0.5到1小时一次。Checkpoint保存自身也有开销,保存一次几分钟,频繁保存会吃掉有效的训练时间,所以保存策略要根据训练的总时长和故障容忍度来权衡。
实际操作中我建议遵循三个原则:第一,Checkpoint必须写到并行文件系统或远端对象存储,不能只存在本地盘;第二,保存动作要做原子化处理,写临时文件、校验完再替换正式文件,防止写入一半崩溃导致整个文件损坏;第三,定期做恢复演练,很多团队只保存不演练,真正要恢复的时候才发现文件不完整,那才是最尴尬的情况。
5.2 RoCE网络拥塞与PFC风暴
RoCE网络的故障排查是2025年智算运维工程师的必修课。最常见的坑是PFC风暴,简单说就是网络里某个节点处理不过来,不停向上游发送暂停帧,导致整个网络链路阻塞。表现是集群中一部分GPU的通信带宽骤降,训练速度突然变得极慢。
排查PFC风暴的思路,第一步是通过交换机的计数器确认哪些端口触发了PFC,第二步顺着端口找到对应的主机,用网卡工具确认是不是主机侧有丢包或慢队列堆积,第三步检查是否出现了TCP/UDP流量混跑的情况——传统业务流量如果和RDMA流量混在一个网络里,几乎必然引发拥塞。
2025年的趋势是直接在物理层面做隔离,RDMA流量走独立网络平面,或者用QoS把不同类别流量严格区分开。网络规划如果在一开始就把RDMA网络和普通业务网络分开了,能省掉大量后续排查成本。
5.3 液冷系统漏液与温度异常
液冷系统引入后,运维团队面对的是全新的故障类型。2025年我处理过的液冷相关问题上,漏液监测和流量异常算两类高频场景。
漏液监测方面,现在的标准做法是在机柜底部和冷板附近部署漏液传感线,一旦有液体泄漏立刻触发告警并联动切断该机柜的冷却液供应。但传感器只能事后报警,日常巡检更重要。我们的做法是每个月对管路接头做一次红外热成像扫描,接头温度异常往往意味着密封圈老化或拧紧力矩不足。
温度异常的排查逻辑和风冷时代完全不同。风冷时代温度高,先怀疑空调效率;液冷时代温度高,大概率是流量分配不均或冷却液温度设置有问题。特别是多机柜并联的场景,越靠近分水器入口的机柜流量越大,末端机柜可能出现流量不足导致GPU温度偏高。解决方法是调平衡阀开度,并且每季度重新做一次水力平衡测试。
5.4 GPU故障的分级处理
GPU本身的故障在2025年也形成了相对成熟的处置方法论。显存ECC错误、GPU掉卡、NVLink通信异常、驱动hang死,处理策略各不相同。
ECC错误分单比特可纠正和多比特不可纠正,前者只需记录观察,后者一般直接判定卡故障,进入RMA流程。掉卡问题先查供电和PCIe链路,再查散热。NVLink异常则大概率是卡间高速链路信号质量问题,先重插再排查金手指氧化,这些都能通过定期运维工具扫描提前发现征兆。
我的经验是建立一套GPU健康巡检体系,每天自动扫描GPU的温度、功耗、ECC错误率、NVLink链路状态,并汇总成健康分数,异常卡提前通知客户交换任务。等GPU真正挂了再去处理,影响的就不是一张卡,而是整个训练任务的进度。
| 故障类型 | 常见表现 | 快速排查方向 | 处置建议 |
|---|---|---|---|
| GPU单比特ECC | 日志频繁报correctable error | 检查显存固件 | 记录观察,不必立即替换 |
| GPU掉卡 | train任务里卡数变少 | 供电、PCIe链路、散热 | 带外重启,连续掉卡走RMA |
| RoCE链路拥塞 | 训练速度骤降 | PFC计数器、丢包率 | 隔离大流量任务,调水线 |
| 液冷接头渗液 | 机柜底部有液体痕迹 | 扭矩、密封圈 | 立即停机保压测试 |
| 存储吞吐下降 | 数据加载变慢 | 客户端连接数、磁盘健康 | 查看慢盘和重建状态 |
6. 2026年智算行业的方向判断:几个确定性的趋势
6.1 推理负载继续爆发,甚至可能超越训练
前面提到2025年推理算力需求开始抬头,2026年这个趋势会更加明显。大模型应用的渗透率还在提升,各家互联网公司、软件公司都在把AI能力集成到现有产品里,每一次API调用都是一次推理计算。推理负载的特点是单次算力需求小、调用频率高、延迟敏感,这会让智算中心的算力分配逻辑进一步发生变化。
对智算中心的启示是,集群架构要同时兼顾训练和推理,而推理对网络延迟的要求比训练更高。推理集群的组网可以不用像训练集群那样追求极致的聚合带宽,但对时延和稳定性更敏感。另外推理业务更适合用X86加GPU的异构方案,CPU负责预处理和调度,GPU专注张量计算,这种架构在成本和能耗上都有优势。
6.2 绿色算力从口号变成硬约束
2025年我接触过的每个智算项目,甲方在招标书里几乎都会提到PUE和绿电使用比例。2026年这个趋势只会更严,绿色算力正在从“企业社会责任”变成“算力项目上马的前置条件”。
怎么做?三个方向并行:一是基础设施层面,液冷、自然冷却、余热回收这些技术持续迭代,把PUE往1.1以下压;二是算力调度层面,把可中断、可迁移的负载调度到绿电供应低谷时段运行,最大化利用绿电;三是硬件层面,关注能效更高的芯片和服务器方案,用同样电力产出更多算力。
这里有一个很容易被忽视的成本账:传统风冷数据中心的制冷系统占整个机房能耗的30%到40%,液冷方案能把这个比例压到10%以下。一个10兆瓦的智算中心,采用高效液冷后一年省下的电费,足以覆盖液冷系统的建设溢价,而且随着时间推移,省的越来越多。
6.3 异构算力统一调度成为刚需
2025年行业里很多算力池还停留在单一芯片品牌、单一型号的阶段,2026年异构算力混合部署会成为主流。国产加速卡大规模进入市场后,同一个智算中心里会有多个品牌的GPU混部,可能英伟达的卡负责训练,国产卡负责推理,或者不同型号的卡跑不同的算法任务。
异构算力最大的挑战在软件栈和调度层。不同芯片的开发框架、驱动、算子库都不一样,抽象层要通过统一接口屏蔽底层差异。调度器要能识别算力标签,按任务需求匹配最合适的硬件,同时把故障隔离做好,避免一块卡拖垮整个集群。2026年智算平台的核心竞争力,很大程度上取决于异构资源的纳管和调度能力。
6.4 智算走向区域协同与算力互联
单个智算中心规模再大,也扛不住所有负载。2025年行业里开始讨论得比较多的“算力互联”,2026年会进入实践阶段。具体场景是,把不同地域的智算中心通过网络连成一张算力网,负载可以在节点之间动态调度,算力资源实现跨地域共享。
这个趋势对网络提出了更高要求。跨地域的算力调度,需要大带宽、低时延的骨干网支撑,数据中心DCI(数据中心互联)技术会随之升级。同时算力调度系统要解决数据本地性和算力距离之间的权衡问题,数据量大的任务尽量在数据所在地就近算,数据量小但对算力要求高的任务可以调度到远处的富余算力节点。这种协同调度,2026年会有不少落地案例。
结语:这一年智算圈子教会我的几件事
梳理完2025年的智算行业变迁,说几个我个人的体会。第一,智算项目成功的关键,越来越不在“买多少张卡”,而在“能不能把卡用起来、用好”。我见过太多集群上线后GPU利用率不到30%的案例,硬件投入越大,利用率越低,亏损就越大。第二,做智算运维,不能只用过去做服务器运维的经验。液冷、RoCE、分布式训练、GPU故障诊断,这些全是新领域,团队必须提前储备能力,等故障来了再去学就晚了。第三,智算行业的竞争已经从技术战转向综合运营效率的比拼,电力成本、冷却效率、调度精细度、故障响应速度,每一个细节都在决定项目的投资回报率。
最后分享一个实操上的小建议:无论你是正在规划智算中心,还是已经建好在运营,一定建立一个“算力全链路监控”体系,从电力输入、冷却系统、GPU运行状态、网络吞吐到训练任务进度,全部打点到统一的监控平台上。我2025年处理过的那些棘手故障,最后能快速定位,绝大多数都靠监控平台提供的交叉数据。这个投入,是智算项目里最值得花的钱。