大模型预训练新范式——视觉预训练反哺语言智能
2026/7/23 17:15:54 网站建设 项目流程

“柏拉图表征假说”提出,文字与图像并非彼此割裂的信息形态,而是同一底层现实在不同模态中的投影。知识也从不只栖身于文字。科学文献、教材与专业书籍本就是图文交织的知识载体:示意图呈现运行机制,分子结构记录空间构型,几何图形揭示位置关系,统计曲线刻画变化趋势—它们以各自的方式共同表达着自然规律。

文字可以描述和转述这些信息,却难以无损地保留其中的空间结构与视觉逻辑。因此,当模型仅从文本中学习时,它所接触到的或许只是科学知识的一种投影,而非知识的完整形态

然而,当前大语言模型 (LLM) 的主流预训练范式仍以纯文本上的“下一词预测”为核心。文档、网页等视觉信息丰富的知识载体,通常需要先经过 OCR 与文档解析,被转换为一维的文本序列后才能进入模型。这种处理方式便于规模化训练,却也在无形中舍弃了原始内容中的版面结构、图文关系、公式形态与空间逻辑,使模型读到的知识从一开始便不再完整。

一项来自上海人工智能实验室和国内高校的联合研究,挑战了“语言模型必须基于纯文本表征进行预训练”的默认假设。研究团队提出了一种视觉预训练范式,通过在连续视觉表征空间中预测下一个视觉单元,模型得以直接从视觉文档中获取知识。

该研究基于国产昇腾算力平台开展,并完成了面向大规模训练场景的系统适配与优化。相关技术已应用于上海人工智能实验室的科学多模态基础大模型书生Intern-S2-Preview 35B/397B系列模型的预训练,有效提升了模型科学推理和多模态理解能力。

论文标题:

Scalable Visual Pretraining for Language Intelligence

论文链接:

https://arxiv.org/abs/2607.09657

HuggingFace链接:

https://huggingface.co/papers/2607.09657

35B模型链接:

https://huggingface.co/internlm/Intern-S2-Preview

397B模型链接:

https://huggingface.co/internlm/Intern-S2-Preview-397B

图1:在统一表征空间进行视觉预训练

图2:相同语料在视觉预训练和文本预训练对比示意图

实验发现

发现一:从视觉文档中,也能学到更强的语言智能

研究首先验证了一个核心预期:如果原始文档页面比解析后的纯文本保留了更完整的知识,那么,直接从这些视觉文档中学习,也应当为模型带来更强的科学推理能力。

实验结果验证了这一判断。在保持科学文献来源、初始模型、训练设置和监督微调数据完全一致的情况下,VP 在 MMLU-Pro、GPQA Diamond、AIME 2025 和 HLE 等纯文本推理基准上,全面优于使用解析文本训练的 TP。该趋势在 Qwen3.5、Qwen3、Llama 3.2 Vision 和 Llama 3.1 等不同模型架构上均稳定出现,其中 GPQA Diamond 最多提升 3.22 分,MMLU-Pro 最多提升约 2.1 分。

图3:视觉预训练和基线的模型能力评测对比

这正是视觉预训练希望实现的目标:输入模型的虽然是文档页面,但模型学习到的并不只是图像的表面特征,而是公式、图表、空间关系与文本内容共同承载的知识。这些最终体现为更强的语言推理能力。

换言之,语言智能并不只能从语言中习得。只要建立合适的预测目标,视觉同样可以成为基础模型学习知识、形成推理能力的有效载体。

发现二:视觉预训练的收益随训练规模持续增长,呼应Scaling law

一种预训练范式能否支撑基础模型发展,关键不仅在于它是否有效,更在于它能否从不断扩大的数据与计算规模中持续获益。

实验表明,VP展现出了清晰的 Scaling 趋势:随着科学文档训练量持续增加,VP 相对于文本预训练的优势并未趋于饱和,而是在 MMLU-Pro、GPQA Diamond 和 AIME 2025 等多个基准上稳定扩大。在完整训练规模下,VP 相对于初始模型的能力增益,分别达到文本预训练的 1.27 倍、2.02 倍和 2.88 倍。

图4:视觉预训练增益随着训练规模增大

这意味着,模型读取的视觉文档越多,从公式、图表、空间结构与复杂版面中吸收的知识也越丰富,并能够进一步转化为不断增长的语言推理能力。视觉预训练因此不只是一个在有限数据上有效的训练目标,也展现出了成为可扩展基础模型预训练范式的潜力。

进一步分析显示,VP 的收益与页面中的视觉结构密度密切相关。在以文字为主、视觉结构较少的样本上,VP 与文本预训练表现接近;随着公式、图表、表格与复杂版面的占比增加,VP 的优势显著扩大。这说明,VP 的收益并非简单来自额外训练,而主要来自文本解析难以完整保留的视觉与空间信息

更重要的是,这种增长建立在更紧凑的视觉表示之上。对于完全相同的科学 PDF,解析后的文本约包含 800 亿个 Token,而经过前景筛选的视觉表示仅包含约 200 亿个视觉 Token。换言之,VP 仅使用约四分之一的文档 Token,便取得了超过文本预训练的效果,体现出更高的信息密度与扩展效率。

发现三:无需显式图文配对监督,也能促进跨模态对齐

传统多模态预训练通常依赖大量图文对、图片描述或人工标注。VP 使用的却只是未经标注的原始文档页面,没有显式的图文配对监督。

尽管如此,经过视觉预训练后,模型中的视觉与文字表征仍然变得更加接近:配对图文表征的余弦相似度由 0.631 提升至 0.907,表征空间的全局结构与局部邻域也呈现出更强的一致性。

图5:视觉预训练和基线的模型多模态能力评测对比

这种跨模态对齐进一步迁移到了实际任务中。在 MMMU-Pro、SFE、ChartQAPro 和 MathVista 等多模态基准上,VP 在不同模型架构下均优于匹配的文本预训练;其中,ChartQAPro 提升约 5.4 分,MathVista 最多提升 4.8 分。

这意味着,即使不依赖人工构造的图文对,模型也可能通过预测原始文档中的视觉内容,在已有语言知识与视觉结构之间建立联系。

方法介绍

视觉预训练的核心是 Next visual latent prediction。首先,原始 PDF 被直接渲染为页面图像,并通过冻结的视觉编码器转换为一系列连续的视觉表征。系统过滤页边距、空白区域等低信息 Patch,同时保留前景内容的空间位置,将其输入语言模型。

训练过程中,文本与视觉文档共享同一个自回归模型:文本数据仍然采用“下一词预测”,视觉文档则采用“下一视觉表征预测”。通过这种方式,模型在保留原有语言学习能力的同时,也能在不依赖 OCR 文本提取、人工标注或显式图文配对的情况下,直接从原始文档页面中吸收知识

与直接生成原始像素不同,VP 预测的是冻结视觉编码器提取的连续潜表征。这一目标弱化了颜色噪声、像素偏差等低层细节的影响,而能够更多地学习视觉内容所承载的知识,例如公式中的符号关系、图表中的变量关联与变化规律、表格中的多维对应,以及复杂版面中的跨区域逻辑。

关键的是,文字与视觉文档训练的是同一个自回归模型。视觉预测产生的训练信号会直接更新承载语言能力的共享模型参数,使视觉文档中的知识不只是停留在外部视觉编码器中,而是逐步进入语言模型的内部表征空间。经过后续的文本监督微调,这些从视觉文档中获得的知识便可以通过语言形式被重新组织和调用,并最终体现在科学推理任务上。

展望

从“阅读文字”到“预测世界”

这些实验共同指向一个结论:从预测语言的下一个符号,到预测世界的下一种表征,基础模型正在获得一种超越文字的学习方式。

未来,随着预测目标进一步拓展到图像、视频与交互数据,模型或许能够逐步建立对现实更完整的内部表征。视觉预训练正是迈向这一方向的一步——改变的不只是进入模型的数据形式,更是模型获取知识、建立预测与理解世界的方式。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询