RAG中30个结果全涨,CorVer只查语料就起飞了
2026/7/22 2:45:52 网站建设 项目流程

数学推理可以调用计算器检查答案,代码生成可以通过编译器和单元测试获得确定性反馈。但在事实问答中,一段回答可能同时包含正确和错误陈述,我们却很难为每句话提供低成本、可扩展的训练奖励。

只检查最终答案,监督信号过于粗糙;逐句调用 NLI 模型、LLM judge 或知识验证管线,又会在强化学习的大量 rollout 中形成巨大的计算瓶颈。

CorVer 提出了一条不同路线:不让另一个神经模型判断事实,而是直接查询语料中的实体共现统计。

图 1:数学和代码拥有低成本程序化验证;CorVer 为事实问答提供基于语料索引的句子级信号。

把 Wikipedia 共现次数变成过程奖励

CorVer 会把模型回答拆分成句子,并对每句话执行三个步骤:

  1. 使用一个 0.5B 参数的轻量模型抽取第一个有效的主语—宾语实体对;
  2. 将实体保留为内容词,并向 Infini-gram 构建的 Wikipedia 索引提交一次 AND 查询;
  3. 根据共现次数所属区间,将该句映射为有界的正向或负向奖励。

句子奖励随后通过 token-to-sentence 对齐分配到对应 token,再与最终答案正确性奖励和格式奖励结合,用于 GRPO 更新。因此,同一条回答中的正确句子和错误句子可以获得方向相反的局部梯度,而不是被一个统一的最终得分一起奖励或惩罚。

整个过程每句话只需要一次 0.5B 抽取器前向计算和一次索引查询,不需要在奖励循环中调用大型神经验证器,推理阶段也不会增加任何成本。

共现真的能代表正确性吗?

共现不是完整的事实核验,因此首先要确认它是否至少提供方向可靠的训练信号。论文对 700 个人工标注句子进行校准分析,发现句子正确率会随共现次数单调增加:

  • 当共现次数为 0 时,句子正确率约为 **23%**;
  • 当共现次数达到 20 次及以上时,正确率上升至 **81%**。

图 2:Wikipedia 共现次数与人工标注正确率呈单调关系,为分段奖励提供了经验依据。

这种信号并不声称“共现即事实”,而是利用大规模语料统计给策略优化提供一个低成本、方向稳定的局部提示。

六个模型、五个基准,30 个结果全部提升

CorVer 在六个 3B–14B 的指令模型和五个事实问答基准上进行评估,共形成 30 个“模型 × 数据集”组合。相较原始模型,30 个组合全部获得正向提升,TriviaQA 平均提高4.1 个百分点

图 3:CorVer 相较原始模型的准确率增益;每个单元格均为正值。

在可实际运行的配置下,CorVer 还在 20 个对比单元格中的18 个超过 FoRAG、RLFH、FSPO 和 KnowRL 等神经验证器基线。以 Llama-3.1-8B 为例,五个基准的平均准确率从 30.64% 提升到 35.27%;在 NQ-Open 上从 40.66% 提升到 48.34%。

消融实验表明,提升不仅来自增加了一项奖励,更来自奖励被分配到正确的句子和 token。把相同共现奖励压缩成一个回答级标量后,效果显著下降;句子级对齐是 CorVer 的关键组成部分。

更密集的奖励,反而更便宜

一次典型训练大约会触发 (1.2 \times 10^5) 次句子级奖励计算。在这一规模下,每次验证都调用神经模型会迅速成为主要成本。

CorVer 在四个基础模型上的平均训练时间为3.2 小时,而四个基线平均需要 14.5–29.5 小时,相当于慢4.8–8.4 倍

图 4:语料索引使 CorVer 能够在保持句子级密集监督的同时显著降低训练时间。

低成本代理信号的边界

CorVer 的优势来自简单,也因此有清晰局限。它只抽取主语和宾语,不理解谓词语义;两个实体即使高频共现,句子中的关系仍可能是错误的。信号也受索引语料覆盖限制:PopQA 分析显示,收益更倾向于出现在 Wikipedia 统计较充分的实体上,而不是最稀有实体上。

一句话总结:CorVer 用“语料中是否有支持痕迹”替代“再调用一个大模型来判断”,为事实问答提供了可在强化学习规模下使用的低成本句子级奖励。

学AI大模型的正确顺序,千万不要搞错了

🤔2026年AI风口已来!各行各业的AI渗透肉眼可见,超多公司要么转型做AI相关产品,要么高薪挖AI技术人才,机遇直接摆在眼前!

有往AI方向发展,或者本身有后端编程基础的朋友,直接冲AI大模型应用开发转岗超合适!

就算暂时不打算转岗,了解大模型、RAG、Prompt、Agent这些热门概念,能上手做简单项目,也绝对是求职加分王🔋

📝给大家整理了超全最新的AI大模型应用开发学习清单和资料,手把手帮你快速入门!👇👇

学习路线:

✅大模型基础认知—大模型核心原理、发展历程、主流模型(GPT、文心一言等)特点解析
✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑
✅开发基础能力—Python进阶、API接口调用、大模型开发框架(LangChain等)实操
✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用
✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代
✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经

以上6大模块,看似清晰好上手,实则每个部分都有扎实的核心内容需要吃透!

我把大模型的学习全流程已经整理📚好了!抓住AI时代风口,轻松解锁职业新可能,希望大家都能把握机遇,实现薪资/职业跃迁~

这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询