1. MLPerf Storage 3.0 到底是什么来头
MLPerf Storage 3.0 榜单公布的时候,国内存储圈直接炸了。因为这次 XSKY 的 MeshFS 分布式文件系统首次参评,就直接在全部 9 个测试项目中拿下第一,而且不是险胜,是在主流企业级存储供应商都参与的情况下刷出来的成绩。这个事儿的含金量,得先把这个基准测试的分量讲清楚才能理解。
MLPerf 是 MLCommons 推出的 AI 基准测试体系,大家比较熟悉的是 MLPerf Training 和 MLPerf Inference,这两个跑的是 GPU 算力和模型训练推理性能。而 MLPerf Storage 是这套体系里专门测存储性能的版本,它不跑模型,而是模拟真实的大模型训练和推理过程中存储系统要承担的负载,用标准化的负载模型去打一套统一的存储性能成绩出来。换句话说,Training 和 Inference 测的是"脑子转得多快",Storage 测的是"喂饭的到底能不能跟上"。
MLPerf Storage 从 1.0 到现在 3.0,每一版都在加大难度。3.0 这个版本最大的变化是加入了 Stable Diffusion 训练负载和 LLM(大语言模型)微调负载,这两个恰好是目前生成式 AI 应用里最典型的存储性能杀手。Stable Diffusion 涉及到海量小文件图片的频繁读取,LLM 微调则会在 checkpoint 保存和读取阶段产生极高的吞吐压力和元数据操作压力。拿第一的难度,可以类比成让一个仓库管理员在一分钟内同时完成快递分拣、货架上架、大件搬运和库存盘点,而且每个环节都要达到行业最高标准。
这一个成绩背后其实有两层意义:第一层是证明 MeshFS 的分布式架构在真实的 AI 训练负载下扛住了压力,而不是只在测试工具里刷了个好看的数字;第二层是给国内整个软件定义存储(SDS)赛道长脸了,因为过去这类权威榜单基本被国外的传统存储大厂包揽,国产分布式存储很少有机会在这种级别的擂台上一较高下。
2. AI 训练对存储系统的要求,和你想象的不一样
2.1 checkpoint 写入:比想象的残酷得多
先说大模型训练里最折磨存储系统的环节——checkpoint 写入。训练一个 7B 参数规模的模型,动辄几千亿个参数要定期落盘保存,这个"定期"可不是隔几个小时做一次,而是在训练过程中每隔几分钟甚至更短就做一次全局状态保存。一旦训练中断,不管是 GPU 故障还是网络抖动,都要从上一次 checkpoint 恢复,所以 checkpoint 的写入速度直接决定了训练集群的故障恢复时间。
写 checkpoint 的时候,成百上千个 GPU 进程会同时往存储系统里写各自节点的完整模型状态。这时候的写入流量是爆发式的,峰值带宽瞬间就能打满整个存储链路,而且是多节点并发写同一个文件。传统的 NAS 存储这种场景下很容易出现锁竞争和元数据瓶颈,导致写速度远低于理论值。MeshFS 能在 MLPerf Storage 3.0 的 LLM 场景里拿下第一,说明它在处理多节点并发 checkpoint 写入时的聚合带宽和一致性处理能力做到了相当高的水平。
2.2 小文件随机读:AI 推理的隐性瓶颈
Stable Diffusion 训练负载测的是存储系统处理海量小文件读取的能力。这个负载模型模拟训练进程从存储上随机读取大量图片样本,每张图几十到几百KB不等,但数量非常庞大,一个训练周期可能要读几百万个文件。这里面真正的挑战不是带宽,而是文件打开速度、元数据响应速度和目录遍历效率。
简单说,传统 HDD 阵列的顺序读速度可能不差,但是一旦面对百万级小文件的随机访问,磁盘寻道和元数据查询开销会直接把性能拖垮。MeshFS 这种软件定义全闪架构的优势这时就体现出来了,它在数据布局、元数据索引、客户端缓存多个层面做了针对性优化,让小文件场景下也能保持高并发随机读的性能稳定。
2.3 数据读取的稳定性:别小看 P95 延迟
MLPerf Storage 的性能结果不只统计平均值,还会关注尾部延迟,也就是 P95、P99 这类的百分位延迟。AI 训练过程中,GPU 每轮迭代都要等数据到位才能计算,所以即使平均延迟看着不错,只要出现偶发的高延迟抖动,整个训练管线就得等,GPU 利用率就下来了。
这也是很多存储系统在 MLPerf Storage 测试里拿不到好名次的原因。有些产品在测试前期带宽和延迟数据都很好,但是随着测试时间拉长,缓存命中率下降、垃圾回收开始介入,尾延迟就飙升上去了。MeshFS 能拿下全部九项第一,说明它在持续压力下的性能稳定性做得很扎实,这比单纯看峰值性能更有含金量。
3. MeshFS 的技术底牌,凭什么能跑出这种成绩
3.1 全闪架构:先定硬件基线再谈优化
MeshFS 是基于全闪存架构设计的分布式文件系统,这一点是先决条件。拿第一的成绩单里包含吞吐量和 IOPS 这些硬指标,HDD 阵列哪怕软件优化做得再好,物理层的机械寻道时间也无解。全闪提供的是低延迟和高吞吐的硬件基础,MeshFS 要做的重点是在这个基础上把分布式软件的并行扩展能力发挥出来。
从公开测试环境的信息来看,这次测试用到的存储集群规模并不夸张,但跑出来的聚合吞吐和 IOPS 数据非常亮眼。这说明 MeshFS 的横向扩展效率很高,没有在节点数量增加时出现明显的性能拐点。对用户来说,这意味着在真实生产环境里,可以通过线性扩容节点数来匹配 AI 集群的存储需求,而不是动不动就得上那种专用硬件的一体机。
3.2 分布式架构优化:数据路径越短越好
分布式文件系统的核心挑战,是把元数据操作、数据读写、一致性保障这些功能分布在多个节点上协同完成,同时不能让协调成本吃掉性能收益。MeshFS 的做法是在数据路径上下功夫:客户端直接和存储节点通信,减少了转发跳数,文件分片和条带化策略会根据文件大小动态调整。
拿写文件来举例,一个大 checkpoint 文件写入的时候,MeshFS 会把文件切成多个 chunk 并行分布到多个存储节点上,聚合写出高带宽。而对小文件场景,它又会切换到低开销的元数据操作模式,避免为每个小文件都走一遍创建、锁、目录挂载的完整流程。这种"大文件重带宽、小文件重效率"的分场景调度,是它能在九项测试里全面领先的原因之一。
3.3 针对 AI 负载的专项适配:ETCD 和原生客户端
MLPerf Storage 的测试环境和真实 AI 集群高度相似,存储系统需要和常见的 AI 调度框架协同工作。MeshFS 针对 Kubernetes 环境做了深度适配,原生支持 CSI 插件,同时提供了高性能的 POSIX 客户端,这套客户端针对 AI 训练中高频出现的大文件流式读写,做了预读、写聚合和页缓存优化。
一个值得一提的细节是,MeshFS 和 etcd 这类分布式键值存储的配合也做了优化。因为在 Kubernetes 环境下,etcd 承担着集群状态存储的职责,存储节点和计算节点之间的状态同步、调度信息的持久化都有可能产生 etcd 的读写压力。虽然不是最核心的性能环节,但在真实环境里这些小环节不优化,遇到高并发时容易变成隐形瓶颈。这套组合拳打下来,MeshFS 在测试里能稳定输出也就不奇怪了。
4. 九项第一分别意味着什么:每项测试背后的真实场景
4.1 九项第一对应的负载模型速查
MLPerf Storage 3.0 的成绩维度分两套主要负载:一个是 LLM 微调场景,另一个是 Stable Diffusion 训练场景。在这两套场景下,分别测试存储系统在数据加载、checkpoint 写入、checkpoint 读取等不同阶段的性能,再加上一些综合性的性能指标。
具体到榜单上的九项,大致对应这么几类:最大吞吐量、最大 IOPS、最低 P95 延迟、最快的 checkpoint 写完成时间、最快的 checkpoint 读完成时间,以及在这些指标下综合资源利用率的表现。简单来说,就是把 AI 训练里存储系统要干的几类脏活累活全部单独拎出来比了一场,MeshFS 每一项都跑到了最前面。
拿 checkpoint 写完成时间来说,这个指标直接衡量的是模型状态保存在存储上要花多久,时间越短,意味着训练中断恢复越快。如果做一次 checkpoint 要从原来的 10 分钟压缩到 2 分钟,意味着在同样长的训练周期里,GPU 有更多时间在算数据而不是等数据落盘。大几千张 GPU 卡构成的大型训练集群里,这种时间节省会累积成很可观的训练效率提升。
4.2 横向对比:其他参评产品怎么看待这个结果
MLPerf Storage 的成绩单目前包含了多家主流存储厂商的送测结果,这些产品大多是在企业级市场深耕多年的老牌产品。MeshFS 第一次参评就包揽九项第一,市场意义在于:用户在选型 AI 存储时,多了一个经过权威验证的本土化选择,而且这个选择在纯粹的存储性能指标上不输任何国际大厂。
需要说明的一点是,基准测试结果会随着参评版本和集群配置不同而有差异,但同一张榜单里公平对比出来的成绩,仍然具备很强的参考价值。以前国产存储产品在性能指标上和国际大厂拉不开明显差距,但对 AI 场景的适配深度经常被质疑,MLPerf Storage 3.0 的这个结果算是给这类质疑做了一个有力的回应。
4.3 对 AI 基础设施选型的影响:存储不再是配角
AI 基础设施的钱主要花在 GPU 上,这是事实,很多团队在规划存储预算时往往用里最便宜的方案——把几个大容量盘塞进一台服务器共享出去,或者直接用对象存储对付。这在模型规模小、训练频率低的情况下勉强能跑,但到了大模型时代就完全不是一回事。
GPU 利用率是整个训练集群最核心的成本指标。存储性能跟不上,GPU 就在空转等数据;GPU 空转的时候,单位算力的成本并没有下降,反而因为整体训练周期拉长导致更多电费和管理成本。MeshFS 在 MLPerf Storage 3.0 上拿到的成绩,给 AI 基础设施规划者提供了一个清晰的参考:分布式全闪存储不是成本中心,而是保障 GPU 算力利用率的基础设施。
5. 我的一些理解和看法
5.1 软件定义存储的机会窗口来了
整个存储行业过去十几年经历过从传统存储在向软件定义存储的演进,但 AI 时代的存储需求来得非常猛烈,传统存储的硬件一体化模式迭代速度已经跟不上了。MeshFS 这种纯软件、可跑在通用硬件上的分布式文件系统,踩准了这个节奏。
对用户来说,软件定义存储最大的现实好处是硬件选择的灵活性。存储节点可以用标准 x86 服务器加 NVMe SSD 来搭建,未来需要扩容时直接加节点,不需要在和某个封闭硬件绑定。性能不够时,升级换代也不用整体推倒重来。MeshFS 在选择这个赛道方向上越走越深,在这轮 AI 存储竞争中已经有了先发优势。
5.2 从测试到生产,多一步性能验证
不过我也要说一句实际的话:基准测试成绩优秀,不代表买回去直接用就能完全发挥出同样的水平。从 MLPerf Storage 里的成绩到用户自己的生产环境,中间至少还隔着一个性能验证的鸿沟。因为每个 AI 集群的数据集规模、模型架构、训练框架、网络拓扑都不一样,存储系统的实际表现会因为具体环境而产生差异。
我认识的不少团队在选型存储时,现在会主动要求进行 POC(概念验证),拿自己真实的数据集和训练脚本在目标存储产品上跑一遍,对比训练一个 epoch 的时间和 checkpoint 保存恢复时间。这个习惯无论是对评测 Storage 还是 MeshFS,都是最务实的方式。先通过基准测试圈定候选产品,再通过 POC 验证实际效果,然后再进行采购决策,这是最稳妥的路径。
5.3 最后说几句小建议
如果你正在为 AI 训练集群选存储,我给你的建议是基于这份成绩单做功课,但不要只看性能数字。多关注这几个点:产品对 Kubernetes 和主流 AI 框架的兼容性、技术支持响应速度、license 模式和扩容成本、以及社区和生态的活跃程度。性能和这些因素综合起来,才能决定一套存储系统在长期使用中的体验。
另一个容易忽略的是运维复杂度。分布式存储架构的部署、调优、故障排查,和传统的单机存储差异非常大,团队里没有专门的存储工程师的情况下,要优先考虑运维友好度。MeshFS 的成长速度很快,但具体到你自己的环境里好不好用,只有真正跑起来才知道。从测试榜单到实际生产,这个距离通常比想象中远,但也正因为有权威基准的验证,方向上的风险已经小了很多。