☰
UltraX预训练实验结果完整解读:1B模型、10大基准、34/50项SOTA
2026/9/25 14:54:35 网站建设 项目流程

UltraX预训练实验结果完整解读:1B模型、10大基准、34/50项SOTA

【免费下载链接】UltraX-Preview项目地址: https://ai.gitcode.com/OpenBMB/UltraX-Preview

这篇文章带你完整解读UltraX官方预训练实验结果:OpenBMB 推出的大规模预训练数据精炼框架,在 5 个英文语料上用1B 参数模型从零预训练 20B tokens,在10 大基准上全部拿下最高平均分,50 项任务-语料组合中赢得34 项 SOTA🏆

📌 实验设置:1B 模型是怎么"考"出来的?

先看实验条件,这是读懂全部数字的前提:

项目设置
模型1B 参数 MiniCPM,从零预训练(不是微调)
训练量每个语料20B tokens
语料5 个经 UltraX 精炼的英文语料(每个约 20B tokens)
评测LightEval 零样本(zero-shot)设定
对比基线Raw(原始语料)与 ProX-C(文档级精炼基线)

也就是说,这不是"给好模型喂好数据"的加分操作,而是同等条件下比数据质量:同样的 1B 模型、同样的训练 token 数,只换训练语料,看谁的成绩更好。这种控制变量设计,正是结论可信的关键 ✅

🎯 10 大基准:每个在考什么?

评测覆盖 10 个主流常识与知识基准,兼顾"知识广度"和"推理深度":

基准考察内容
ARC-C小学三年级科学推理(挑战版)
ARC-E小学五年级科学推理(简易版)
CSQA大学水平常识科学问答
HellaSwag日常情境常识推理
MMLU57 个学科的多任务知识大考
OBQA物理常识问答
PIQA物理交互常识
SIQA社交意图常识推理
WinoGrande代词消解与语言常识
SciQ小学科学四选一

5 个语料 × 10 个基准 =50 个"任务-语料"组合,这就是"34/50"的分母来源。

🏆 核心结论一:34/50 项 SOTA 意味着什么?

UltraX 精炼语料在全部 5 个语料上的平均性能都是第一名,并在 50 项组合中赢得34 项最佳(68% 胜率)。

对新手来说,"平均第一"比"单项第一"更重要:它说明 UltraX 的精炼是全面提纯,而不是在个别简单基准上"刷分"。5 个语料来源差异很大(Common Crawl 网页、多源网页、HTML 高保真解析、质量过滤版、文档级精炼版),全部夺冠说明方法具有泛化性,而非只对某一类数据有效 📊

📈 核心结论二:平均相对提升 2.00% 与 1.53%

论文的关键数字:

  • 相比Raw(未精炼原始语料):UltraX 平均相对提升约 2.00%
  • 相比ProX-C(已相当强的文档级精炼基线):UltraX 平均相对提升约 1.53%

在预训练领域,2% 的平均相对提升是重量级成果——通常这意味着同等算力下模型"变聪明了",或同等效果下训练成本更低。更值得注意的是 UltraX 还要和 ProX-C 比:它赢过的不是一个弱基线,而是业界公认优秀的精炼方法。

⚡ 核心结论三:数据效率——16B tokens 追平并反超 20B 基线

这可能是最有说服力的一个发现:

在 FineWeb 语料上,UltraX 仅训练16B tokens(平均 45.49 分),就已超过 Raw(45.08 分)和 ProX-C(45.05 分)训练满20B tokens的最终成绩。

翻译成"人话":

  1. 少喂 20% 的数据,成绩反而更高—— UltraX 的每个 token 都更"值钱";
  2. 对工程团队意味着真金白银的算力节省:更早达到目标性能,更短的训练周期;
  3. 说明精炼带来的不是"噪声减少"这么简单的效果,而是有效信息密度的提升。

数据质量优化的价值,在这条曲线上体现得淋漓尽致 ⚡

🗂️ 数据在哪里:5 大语料文件速查

本仓库直接包含 5 个精炼语料的全部分片文件(共 479 个 parquet 分片):

数据集源语料分片数数据目录
UltraX-FineWebFineWeb(Common Crawl 网页)104data/UltraX-FineWeb/
UltraX-RedPajama-V2RedPajama-v2(多源网页)110data/UltraX-RedPajama-V2/
UltraX-AICCAICC(HTML 高保真网页)61data/UltraX-AICC/
UltraX-Ultra-FineWebUltra-FineWeb(质量过滤)104data/UltraX-Ultra-FineWeb/
UltraX-FineWeb-ProX-DocFineWeb-ProX-Doc(文档级精炼)100data/UltraX-FineWeb-ProX-Doc/

每个 parquet 文件固定 5 列,方便你做前后对比:

列名含义
uid唯一标识(raw_content 的 MD5 哈希)
raw_content精炼前的原始文本
cleaned_contentUltraX 精炼后的文本
processed_functions实际执行的编辑操作记录
source源语料名称

raw_content与cleaned_content并排存放是个贴心设计——你可以直接对比同一条样本的编辑前后差异,理解"精炼"到底改了什么。示例文件可参考 data/UltraX-FineWeb/UltraX-FineWeb-en-part-0001-of-0104.parquet 📦

🧠 为什么 UltraX 能赢?方法速览

看完结果,用一分钟理解它背后的核心设计(详见 README.md):

  1. 函数调用式精炼,而非端到端改写:传统方法要么靠人工规则,要么让大模型整篇重写。UltraX 训练一个轻量精炼模型预测 5 种结构化编辑操作——keep_all(无需修改)、remove_all(整篇无价值,如错误页/登录墙)、remove_lines(删行)、replace_str(行内替换)、add_line(插入新行),再在原文上确定性执行,可控且可审计;
  2. LAM + DCR 流水线:行级对齐映射(LAM)把原文与精炼文本逐行对齐,动态上下文替换(DCR)把字符级编辑转成带唯一上下文锚定的可靠替换操作;
  3. 为大规模而生:滑动窗口推理、重叠感知聚合、歧义过滤、同行操作合并、重复模式检测,保障数亿级文档的可靠执行。

一句话总结:不是"重写内容",而是"精准手术"——这正是它能同时保证质量与效率的原因 💡

🚀 快速上手:3 步开始使用

  • 第 1 步:按配置名加载对应语料,5 个配置与数据集一一对应:UltraX-FineWeb、UltraX-RedPajama-V2、UltraX-AICC、UltraX-Ultra-FineWeb、UltraX-FineWeb-ProX-Doc;
  • 第 2 步:训练时直接使用cleaned_content列作为输入文本,raw_content留作对照与复现;
  • 第 3 步:若资源有限,可优先从 FineWeb 语料入手——它的 16B tokens 反超实验就是数据效率的最佳例证。

💬 新手常见疑问

Q:为什么不直接看单项分数,要看平均分?A:单项可能有波动,平均分反映整体能力水位。而 UltraX 是"平均分全第一 + 单项 34/50 第一",两个口径同时成立,结论才站得住。

Q:20B tokens 对 1B 模型够吗?A:这是学界常见的"小模型大语料"验证设置——参数小、训练快,但足以暴露数据质量差异,是性价比极高的对比实验方案。

Q:UltraX 适合我用吗?A:如果你的预训练语料来自网页抓取(Common Crawl 类),UltraX 的逐例精炼思路与这套现成精炼语料都值得直接借鉴或试用;如果是代码/数学等垂域语料,可参考其函数调用式精炼思路自建精炼管线。

📝 结语

回到文章开头的那组数字:1B 模型、10 大基准、34/50 项 SOTA、2% 平均相对提升、16B tokens 反超 20B 基线——它们共同指向一个结论:在预训练时代,数据精炼就是"免费的算力"。UltraX 用函数调用式编辑把这种"免费算力"做成了可复现的工程方法,而这 5 套精炼语料就放在仓库里,随时可以验证。🎉

【免费下载链接】UltraX-Preview项目地址: https://ai.gitcode.com/OpenBMB/UltraX-Preview

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询