CoSearch: Joint Training of Reasoning and Document Ranking via Reinforcement Learning for Agentic Se
2026/7/27 23:47:32 网站建设 项目流程

一、研究背景与问题

智能体式搜索是指让LLM通过迭代推理、生成搜索查询、观察检索结果来回答复杂问题的过程。现有方法(如Search-R1)虽然通过强化学习(RL)训练推理智能体,但将检索系统视为固定工具,不对其进行优化。

核心问题:作者通过Oracle检索实验发现,固定检索系统是性能瓶颈——将包含正确答案的文档强制排到最前面,能使7B智能体的F1提升+14.7%,3B智能体提升+26.8%。这证明即使推理能力再强,检索质量也严重制约了系统上限。

二、核心方法:COSEARCH框架

作者提出COSEARCH,实现推理智能体与检索排序器的联合RL训练。系统架构如下:

  • 主智能体(Main Agent):以ReAct风格循环运行,生成思考(reason)和搜索查询,最终给出答案。

  • 检索系统拆分为两阶段

    • 固定稠密检索器(Dense Retriever):从知识库中召回Top-50候选文档。

    • 可训练生成式排序器(Generative Ranker):对候选文档进行重排序,选出Top-5供主智能体观察。

两者通过组相对策略优化(GRPO)同时训练,奖励基于最终答案的正确性。

三、关键技术挑战与解决方案

1. 语义分组策略(解决GRPO输入不一致问题)

  • 挑战:GRPO要求同一组内多个响应来自完全相同的输入提示。主智能体的输入都是同一用户查询,自然满足;但排序器的输入包含子查询,不同轨迹产生的子查询各不相同,无法直接分组。

  • 解决方案

    • 利用不同轨迹中大量子查询在语义上等价(仅措辞不同)。

    • 对同一用户查询下的所有子查询,按令牌级F1相似性进行贪心聚类(阈值δ=0.8)。

    • 丢弃成员数少于3的小组,确保优势估计稳定。

    • 无需额外采样,直接复用主智能体已生成的轨迹。

2. 复合奖励设计(解决信用分配问题)

  • 挑战:仅用最终答案正确性作为奖励,无法准确评估每个检索步骤的贡献;仅用相关性标签,又无法监督那些不直接包含答案但对推理有用的中间文档。

  • 解决方案:设计复合奖励 rrank​:

    • 相关性奖励 rrel:基于伪相关性标签(文档是否含标准答案),计算 Hit@1、Hit@3、Hit@5 的平均值,提供即时排序质量信号。

    • 轨迹级别奖励 rmain​:基于最终答案的令牌级F1分数,提供长程效用信号。

    • 根据候选集中是否存在相关文档以及当前排序质量,动态组合两者(公式6),避免噪声传播。

四、实验设置与结果

数据集与基线

  • 7个QA基准:单跳(PopQA, NQ, TriviaQA)和多跳(HotpotQA, 2Wiki, Musique, Bamboogle)。

  • 基线与变体:Direct Inference、CoT、RAG、Search-o1、Search-R1、ZeroSearch,以及内部变体Retrieval Only(无排序器)和Fixed Ranker(排序器冻结)。

主要结果

  • COSEARCH(7B主智能体+7B排序器)平均F1达到0.568,相比Search-R1相对提升+6.6%,相比Retrieval Only提升+4.0%,相比Fixed Ranker提升+2.7%。

  • 3B主智能体+7B排序器:平均F1达0.471,相比Search-R1相对提升+10.0%,验证了较弱推理能力下检索优化的更大收益。

  • 缩小了与Oracle上限约26%–27%的检索差距。

消融实验关键发现

  • 移除语义分组策略导致最大性能下降(-3.3%),证实其对稳定训练至关重要。

  • 移除相关性奖励 rrel 下降2.8%,移除轨迹奖励 rmain​ 下降1.4%,两者互补。

  • 共享主智能体和排序器的骨干网络会因梯度冲突导致性能下降(-1.6%)。

  • 排序器规模缩至3B会导致训练发散,说明较小模型难以处理50个候选的排列输出。

动态分析

  • COSEARCH的排序质量(Hit@5)在训练中从低于Fixed Ranker逐步超越,并与下游F1正相关。

  • COSEARCH和Oracle所需搜索轮次更少(平均1.67轮 vs. Fixed Ranker的2.62轮),表明高质量检索减少了迭代次数。

  • 排序器的组大小在训练中单调增长,反映子查询趋于一致。

五、核心贡献总结

  1. 识别瓶颈:通过Oracle检索实验,量化证明了检索系统是智能体式搜索的主要性能瓶颈。

  2. 提出框架:首次实现推理智能体与检索排序器的联合RL训练,使检索系统能够自适应地服务于推理需求。

  3. 技术创新

    • 语义分组策略,解决GRPO在排序器训练中的输入不一致问题。

    • 复合奖励设计,兼顾即时排序精度和长程答案正确性。

  4. 实验验证:在多个基准上取得一致领先性能,且各项设计决策均有消融支持。

  5. 开放源码:提供代码以促进后续研究。

六、研究定位与展望

  • 与现有工作的区别:区别于仅训练推理智能体(Search-R1)或仅通过监督学习训练检索器(Agentic-R),COSEARCH实现了端到端RL联合优化,且奖励完全基于规则,无需昂贵的LLM标注。

  • 未来方向:作者指出,联合训练推理与检索是未来搜索智能体的关键要素,可进一步探索更复杂的检索信号、更高效的训练策略,以及在其他工具增强场景下的推广。

这里是自己的论文阅读记录,感兴趣的话可以参考一下,如果需要阅读原文的话可以看这里,如下所示:

项目地址在这里,如下所示:

摘要

智能体式搜索——即训练智能体通过迭代推理、发出查询并综合检索到的信息来回答复杂问题的任务——通过强化学习(RL)已取得显著进展。然而,现有方法(如 Search-RI)将检索系统视为一个固定工具,仅优化推理智能体,而检索组件保持不变。一项初步实验表明,在七个问答基准测试上,使用Oracle检索与固定检索系统之间的差距高达 +26.8% 的相对 F1 提升,这表明检索系统是扩展智能体式搜索性能的关键瓶颈。受此发现启发,我们提出了 COSEARCH,一个通过组相对策略优化(GRPO)联合训练多步推理智能体和生成式文档排序模型的框架。为了实现对排序器(其输入随推理轨迹变化)进行有效的 GRPO 训练,我们引入了一种语义分组策略,该策略根据令牌级别的相似性对子查询进行聚类,无需额外展开即可形成有效的优化组。我们进一步设计了一个复合奖励,结合了排序质量信号和轨迹级别的结果反馈,为排序器提供即时的和长程的学习信号。在七个单跳和多跳问答基准上的实验表明,该方法相对于强基线方法取得了持续改进,消融研究验证了每个设计选择的有效性。我们的结果表明,推理智能体和检索系统的联合训练不仅可行,而且性能强大,这指出了未来搜索智能体的一个关键要素。

1 引言

大型语言模型(LLM)已展现出强大的推理能力,但当问题需要超出其参数化训练数据的知识时,它们面临根本性挑战。检索增强生成(RAG)(Lewis et al.,2020;Zamani et al.,2022)通过允许模型通过检索访问外部知识来解决此限制。虽然早期方法依赖于单轮检索后生成答案,但最近的工作表明,多步智能体式搜索——即模型迭代推理、生成搜索查询并整合检索信息——在知识密集型任务上产生了显著更强的性能(Trivedi et al.,2023;Khattab et al.,2021;Shi et al.,2024b)。在这些智能体式搜索系统中,一个智能体迭代地与检索系统交互:智能体推理需要什么信息,发出搜索查询,观察检索到的文档,并重复此过程,直到收集到足够证据以产生最终答案。通过强化学习(RL)训练此类智能体,其中奖励基于最终答案的正确性,已被证明能有效教会它们何时以及搜索什么(Jin et al.,2025;Li et al.,2025b;Zeng et al.,2026)。尽管取得了这些进展,但这些系统的一个共同假设是检索模型或搜索引擎保持不变。这意味着智能体将检索模型视为一个工具并学习使用它,而该工具并不适应。

表 1:Oracle 检索差距(F1 分数)。性能为单跳(PopQA, NQ, TQA)和多跳(HotpotQA, 2Wiki, Musique, Bamboogle)基准测试的平均值。

我们认为这个假设引入了一个显著的瓶颈。通过对 RL 训练的搜索智能体的分析,我们观察到大多数错误并非源于推理过程,而是源于检索组件:智能体发出的查询看起来很合理,但检索系统未能返回相关文档,迫使智能体要么用重新表述的查询重试,要么从嘈杂信息中得出错误结论。为了量化这一差距,我们进行了一项 Oracle 检索实验:在每个检索步骤,我们将所有匹配标准答案的文档提升到最前面的位置;对于没有检索文档匹配标准答案的子查询,则保持排序不变(详见附录 F)。如表 1 所示,这个简单的干预措施在七个 QA 基准上,对于 7B 参数智能体平均 F1 持续提升了 +14.7%,对于 3B 智能体则提升了 +26.8%,表明无论智能体的推理能力如何,检索瓶颈普遍存在。这些发现引出了以下问题:我们能否将检索系统与多轮推理智能体联合优化,使它们学会相互补充以提供准确的回答?

在本工作中,我们提出了 COSEARCH,一个强化学习(RL)框架,用于联合训练用于智能体式搜索任务的主推理智能体和生成式排序器。主智能体以标准的 ReAct 风格循环(Yao et al.,2023b)运行,生成思考和搜索查询。生成式排序器接收主智能体的子查询以及来自固定第一阶段稠密检索器的候选文档,并选择和重排序一个子集供主智能体观察;检索器和排序器共同构成检索系统。主智能体和排序器使用组相对策略优化(GRPO)(DeepSeek-AI et al.,2025)同时训练,奖励来源于最终答案的正确性。

将 GRPO 应用于排序器引入了两个关键技术挑战。首先,GRPO 需要根据来自相同输入提示的多个响应组成的组来计算优势。虽然这对于主智能体来说很自然——从同一用户查询中采样多个轨迹——但排序器在不同轨迹中接收不同的子查询,阻碍了直接分组。我们通过一种语义分组策略解决了这个问题,该策略根据令牌级别的 F1 相似性对子查询进行聚类,无需额外展开即可形成有效的 GRPO 组。其次,排序器对最终答案的影响是间接的:如果推理失败,好的检索仍可能产生错误答案,反之亦然。我们设计了一个复合奖励,结合了基于排序质量指标(Hit@k)的相关性奖励和反映最终答案正确性的轨迹级别奖励,为排序精度提供即时反馈,并为下游效用提供长程信号。两个奖励组件均使用基于规则的指标计算,无需昂贵的 LLM 标注。

遵循先前工作(Jin et al.,2025),我们在涵盖单跳(PopQA, NQ, TriviaQA)和多跳(HotpotQA, 2WikiMultiHopQA, Musique, Bamboogle)设置的七个 QA 基准上评估 COSEARCH。使用 Qwen2.5-7B-Instruct 作为主智能体和排序智能体的骨干网络,我们的方法持续优于强基线,包括 Search-R1(Jin et al.,2025)和固定排序器变体。我们还展示了 3B 主智能体搭配 7B 排序器的有效性。我们的主要贡献如下:

  • 我们确定了检索质量是 RL 训练的智能体式搜索系统中的关键瓶颈:Oracle 检索实验显示,对于7B 推理智能体的相对 F1 增益为 +14.7%,对于 3B 智能体为 +26.8%,证明了固定检索系统带来的显著且普遍存在的性能上限。

  • 我们提出了 COSEARCH,一个通过 RL 联合训练推理智能体和生成式文档排序器的框架。为实现这一点,我们引入了一种语义分组策略,用于在输入随轨迹变化的情况下将 GRPO 应用于排序器,以及一个复合奖励,结合了排序质量与轨迹级别的答案正确性。

  • 在七个 QA 基准上的实验表明,相对于强基线取得了一致改进,使用 7B 智能体相比 Search-R1 实现了 +6.6% 的相对 F1 提升,使用 3B 智能体则提升了 +10.8%。我们的结果表明,检索系统和推理智能体的联合训练不仅可行,而且性能强大,很可能是未来搜索智能体的一个关键要素。

2 相关工作

智能体式搜索与深度研究。检索增强生成(Lewis et al.,2020;Guu et al.,2020;Borgeaud et al.,2022;Karpukhin et al.,2020a)使 LLM 能够访问外部知识,但单轮检索在需要多步证据收集的复杂问题上常常失败。这推动了将推理与检索交错进行的智能体式搜索系统的发展(Yao et al.,2023a;Trivedi et al.,2023;Asai et al.,2024),近期的深度研究智能体(OpenAI,2025;Google,2025;Nakano et al.,2021)将大型推理模型与网络搜索结合以处理复杂查询。RLVR 的出现进一步使得能够直接根据答案正确性训练搜索智能体(Jin et al.,2025;Li et al.,2025a;Song et al.,2025;Li et al.,2025b;Sun et al.,2025b;Guan et al.,2025;Zeng et al.,2026)。

为 LLM 训练检索器。另一条工作线为下游 LLM 生成调整检索。先前的方法通过语言模型监督训练检索器(Guu et al.,2020;Shi et al.,2024a;Sachan et al.,2021;Salemi & Zamani,2024),而最近的工作表明 LLM 可以作为有效的列表式排序器(Sun et al.,2023;Pradeep et al.,2023)。最相关的是 Agentic-R(Liu et al.,2026),它通过 LLM 标注的标签和迭代对比学习为智能体式搜索训练稠密检索器。相比之下,COSEARCH 使用一个生成式排序器,在同步联合框架中通过 RL 进行端到端训练,仅需轻量级的基于规则的奖励。

用于工具增强型 LLM 的 RL。RLVR(OpenAI,2024;DeepSeek-AI et al.,2025;Lambert et al.,2025;Kaufmann et al.,2025)已成为优化 LLM 的关键范式,其中无价值函数的方法如 GRPO(Shao et al.,2024)和 RLOO(Ahmadian et al.,2024)为 PPO(Schulman et al.,2017)提供了更简单的替代方案。将 RLVR 应用于工具增强设置引起了越来越多的兴趣(Li et al.,2025c;Feng et al.,2025a;Dong et al.,2025b;Wang et al.,2025;Feng et al.,2025b;Xue et al.,2025;Dong et al.,2025a),但这些工作侧重于训练推理智能体以更有效地使用工具。相比之下,我们的工作将 GRPO 应用于训练工具本身,特别是排序器。

3 方法

我们提出 COSEARCH,一个通过强化学习(RL)联合优化多步推理(主)智能体和生成式文档排序器的框架(见图 1)。我们首先形式化框架(§3.1),描述主智能体优化(§3.2),然后详述我们的两个核心技术贡献:用于将 GRPO 应用于排序器的语义分组策略(§3.3)和复合奖励设计(§3.4)。

3.1 问题表述

我们将智能体式搜索形式化为一个包含推理(主)智能体和检索系统的系统。给定一个初始用户查询 q0​,主智能体 πθmain​​ 通过一系列推理和检索步骤与检索系统交互,产生一个轨迹:

3.2 主智能体优化

3.3 排序器优化

每个剩余的组 gm​ 包含在相同 q0​ 下具有语义等价输入的排序器调用,形成一个有效的 GRPO 组。优势在每个组内使用标准组归一化计算。此策略不产生额外采样成本:我们复用已为主智能体生成的轨迹,而不是为排序器执行单独的展开。我们在附录 C 中提供了详细算法和图示。

3.4 排序器奖励设计

排序器旨在通过在每个搜索步骤提供有用的文档,帮助主智能体解决多步推理任务。然而,奖励设计并非易事。基于最终答案正确性的轨迹级别奖励无法准确地将信用分配给各个搜索步骤,因为每一步的贡献都与后续检索决策以及主智能体的推理混合在一起,使得信号嘈杂且不稳定。基于相关性的奖励在我们的设置中也有一个重要限制。由于伪相关性标签是通过将文档与标准答案匹配构建的,它们无法监督那些检索到的文档对于分解或推理有用但未直接提及最终答案的中间检索步骤。为解决这两个问题,我们使用一个结合了轨迹级别监督和相关性监督的复合奖励。

总之,复合奖励 rank​ 在相关文档存在但排序不佳时优先考虑排序精度,在排序已经很强时添加轨迹级别的信用,在候选集中没有相关文档时回退到仅使用答案正确性信号。

4 实验

4.1 实验设置

数据集。我们在涵盖单跳和多跳设置的七个 QA 基准上进行评估:PopQA(Mallen et al.,2022)、Natural Questions(NQ)(Kwiatkowski et al.,2019)、TriviaQA(TQA)(Joshi et al.,2017)、HotpotQA(Yang et al.,2018)、2WikiMultiHopQA(2Wiki)(Ho et al.,2020)、Musique(Trivedi et al.,2022)和 Bamboogle(Press et al.,2023)。我们使用 Search-R1(Jin et al.,2025)中的测试分割以进行一致比较。性能通过令牌级 F1 分数衡量。

基线。我们比较了 Direct Inference、CoT(Wei et al.,2023)、RAG(Lewis et al.,2020)、Search-o1(Li et al.,2025a)、Search-R1(Jin et al.,2025)、ZeroSearch(Sun et al.,2025a)以及两个内部变体:(1)Retrieval Only,移除排序器并直接使用稠密检索器的前 K 个文档;(2)Fixed Ranker,使用在基于相关性的 IR 数据集上微调但在 RL 训练期间冻结的排序器。

表 2:在七个 QA 基准上的主要结果(令牌级 F1)。结果按主智能体骨干网络分组。COSEARCH 排序器在两种设置中均使用 Qwen2.5-7B-Instruct。每个规模块内的最佳结果以粗体显示。Oracle(灰色)将包含答案的文档提升至排名第一,作为排序的上限。

4.2 主要结果

表 4.2 展示了所有七个基准的完整结果。我们观察到:

联合训练持续优于所有基线。COSEARCH 使用 7B 智能体实现了 0.568 的平均 F1,相比 Search-R1 相对提升了 6.6%,相比 Retrieval Only 提升了 4.0%,相比 Fixed Ranker 提升了 2.7%。这种改进在所有七个基准上均保持一致,表明联合训练排序器提供了稳健且普遍的益处。在非 RL 基线中,RAG 相比直接推理提升了 22.5%(0.365 vs. 0.298),Search-R1 进一步超越了 RAG 46.0%(0.533 vs. 0.365),证实了迭代推理的价值,然而 COSEARCH 通过优化检索系统本身进一步提升了性能。

较弱的智能体从检索改进中受益更多。使用 3B 主智能体搭配 7B 排序器,COSEARCH 相比 Retrieval Only 实现了 7.0% 的相对增益,相比Fixed Ranker 实现了 2.4% 的相对增益。与 Oracle 上限相比,COSEARCH 为 7B 智能体缩小了约 27% 的检索差距,为 3B 智能体缩小了约 26%,证实了端到端 RL 优化有意义地缩小了性能天花板。

表 3:消融研究。主智能体使用 Qwen2.5-7B-Instruct。每行改变完整模型的一个组件。平均值分别在单跳和多跳组内计算。

4.3 消融研究

表 4.3 报告了消融结果。在奖励设计方面,移除轨迹级别奖励 rmainrmain​ 使平均 F1 相对下降了 1.4%,而移除排序质量奖励 rrelrrel​ 则导致了更大的下降(2.8%),证实了两个组件提供了互补的监督:rrelrrel​ 提供了关于检索精度的直接信号,而 rmain​ 捕获了检索到的文档是否真正有助于最终答案的正确性。将 Hit@k 替换为 nDCG@k 使性能相对下降了 2.1%,用 LLM-as-judge 替代复合奖励导致了 1.8% 的下降——两者均证实了我们的复合设计有效且计算轻量。

移除语义分组和过滤策略——将所有共享相同初始查询 q0q0​ 的排序器调用视为一组,而不论子查询相似性如何——导致了最大的单组件性能下降,相对下降了 3.3%(0.568→0.549)。这证实了将语义异构的子查询混合到一个 GRPO 组中会产生噪声优势估计,阻碍排序器学习,并且 §3.3 中描述的过滤步骤对于稳定训练至关重要。

在架构选择中,共享骨干网络导致 F1 下降了 1.6%,原因是排序和推理梯度存在冲突。交叉编码器排序器下降了 2.9%:其点式评分不适合直接 RL 优化。将排序器缩小到 3B 导致训练完全发散——较小的模型无法在 50 个候选项上可靠地生成有效的排列输出(见附录 A.2)。

4.4 分析

图 2 在 100 个训练步骤中,从三个维度比较了所有四个系统。面板 (a) 和 (b) 揭示了排序质量(Hit@5)与下游 F1 之间存在清晰的正相关关系,COSEARCH 的排序器起始低于 Fixed Ranker,但在训练过程中稳步超越。面板 (c) 显示 COSEARCH 和 Oracle 需要更少的搜索轮次,表明更高质量的文档减少了额外检索轮次的需求。

图 3 追踪了排序器的训练动态。在面板 (a) 和 (c) 中,过滤前的奖励最终收敛于过滤后的奖励,表明分布差距逐渐被弥合。面板 (b) 显示过滤前的相关性奖励稳步上升(从 ∼0.35 到 ∼0.50),表明排序能力有了真正的提高。面板 (d) 显示组大小单调增加,

图 2:100 步内的训练和评估动态。(a) 每 20 步的验证 F1(7 个数据集的平均值)。(b) 每个训练步骤的排序质量(Hit@5);y 轴断开以显示 Oracle =1.0=1.0 在上方。(c) 每个轨迹的平均搜索轮数。

图 3:100 步内的排序器训练动态。过滤前:所有语义组的统计信息;过滤后:通过 §3.3 中描述的最小大小过滤的组的统计信息。(a) 主智能体奖励。(b) 相关性奖励(Hit@5)。(c) 复合奖励。(d) 平均语义组大小。

过滤后的组大小约为过滤前的两倍,反映了随着策略收敛,子查询变得越来越一致。

表 4:排序文档数量 K 对平均 F1 的影响。排序器从 N=50 个第一阶段候选中选择前 K 个。K=5(粗体)是表 4.2 中使用的默认值。括号中的百分比表示与每种方法 K=5 相比的相对变化。

表 4.4 考察了 K 如何影响性能。当 K 从 5 减少到 1 时,COSEARCH 仅下降了 5.3%,与 Oracle(−2.2%)相当,远小于 Retrieval Only(−8.8%)和 Fixed Ranker(−7.2%)。值得注意的是,COSEARCH 在 K=3 时(0.561)已经超过了 Fixed Ranker 在 K=10 时(0.559)的性能,并且将 K 从 5 增加到 10 对所有方法的回报都在递减(+0.5% 到 +1.6%)。

结论

在这项工作中,我们确定了检索质量是智能体式搜索系统的一个重要瓶颈,Oracle 检索差距高达 +26.8% 的相对 F1。受此发现启发,我们提出了 COSEARCH,一个通过 RL 联合训练推理智能体和生成式文档排序器的框架。我们的语义分组策略使得无需额外展开即可对排序器进行高效的 GRPO 训练,而我们的复合奖励提供了即时的排序质量信号和长程的轨迹级别信号。在七个 QA 基准上的实验证明了一致的改进,使用 7B 智能体相比 Search-R1 实现了 +6.6% 的相对 F1 提升,使用 3B 智能体则实现了 +10.0% 的提升。我们的结果表明,推理和检索的联合训练不仅可行,而且性能强大,这指出了未来搜索智能体的一个关键要素。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询