gpt-researcher 私有文档深度研究基准:解构 Q1 2026 运营报告语料与 hybrid 模式的内部事实覆盖率
【免费下载链接】gpt-researcherAn autonomous agent that conducts deep research on any data using any LLM providers项目地址: https://gitcode.com/GitHub_Trending/gp/gpt-researcher
本文以仓库中 q1_2026_ops_report.md 这份虚构的 Veltrix Dynamics 运营报告为切入点,完整解读它在 gpt-researcher 深度智能体(Deep Agents)混合研究基准(hybrid benchmark)中的角色:它是一份 ground-truth 事实文档,被语料工程脚本转换为 PDF 并入私有文档库,再通过 hybrid_benchmark.py 的三臂对照实验,量化验证
source: hybrid模式下 GPT Researcher 对"私有文档 + 网络"的联合研究能力。读完本文,你将掌握:这类可控基准语料是如何设计的(虚构公司防信息泄漏、多格式转换、过期版本陷阱、干扰项),内部事实检查点如何从文档指标逐条映射而来,以及如何在本地复现并扩展这套评估。
一、定位:一份虚构运营报告如何成为深度研究的"事实标尺"
这份文档标题为"Q1 2026 Operations Report - Veltrix Dynamics",标注Internal - Confidential | Prepared by: COO office, April 14, 2026,内容涵盖机队性能、营收、事故、供应链与风险跟踪五个板块,总共只有 38 行。它的技术价值并不在于"运营报告"本身,而在于它是 gpt-researcher 混合研究基准中四份 ground-truth 事实文档之一。
在 build_corpus.py 的模块文档中可以看到清晰的说明:语料库把internal_docs_src/下四份事实文档转换成真实企业文档共享中常见的形态——
| 事实文档(源) | 语料库中的形态 | 生成路径 |
|---|---|---|
| q1_2026_ops_report.md | internal_docs/ops/q1_2026_ops_report.pdf | |
| board_memo_2026_strategy.md | internal_docs/board/board_memo_2026_strategy.pdf | |
| vlx500_product_brief.md | DOCX | internal_docs/product/vlx500_product_brief.docx |
| company_overview.md | Markdown | internal_docs/company_overview.md |
为什么必须是虚构公司?注释中明确写道:语料基于一家fictional(虚构)的 AMR 机器人公司 Veltrix Dynamics,"so no fact can leak from the public web"(确保没有任何一条事实能从公开网络泄漏)。这一点是整套基准成立的前提——只有保证这些内部指标在网络上是检索不到的,评估"hybrid 模式能否从私有文档中恢复内部事实"才有意义:任何 agent 都无法通过纯网络搜索"作弊"拿到答案。
二、文档内容逐项解读:每一行数据都是一个检查点
这份文档的全部指标在 hybrid_benchmark.py 的internal_checkpoints中被逐条固化,作为 LLM 评分官对照的 ground truth。逐板块拆解如下。
2.1 Fleet performance(机队性能)
- 部署机队:3,120 台 VLX-400 机器人,覆盖 47 个客户站点(欧盟 29、北美 14、日本 4)
- 机队可用率:99.2%(目标 99.0%)
- 平均故障间隔时间(MTBF):2,340 小时,环比提升 9%
- 单台机器人每小时平均拣选次数:142(同类 AMR 行业基准约为 100–120)
这些指标在检查点中浓缩为:"The deployed fleet is 3,120 robots across 47 sites, with 99.2% availability in Q1 2026." 而 MTBF 与拣选效率同样出现在 2025 年旧版报告的存档中(详见第三节的"vintage 陷阱")。
2.2 Revenue(营收与财务轨迹)
- Q1 2026 营收:$21.4M(Q1 2025 为 $12.8M,同比+67%)
- RaaS(机器人即服务)年化经常性收入 ARR 在 Q1 末达到$46.9M
- 综合毛利率:41%(硬件 28%、RaaS 63%)
对应检查点:"Q1 2026 revenue was $21.4M (+67% YoY) with RaaS ARR of $46.9M; the 2026 revenue target is $96M." 注意检查点中还引用了战略备忘录中的全年营收目标 $96M,这提示:评估不只是"单份文档检索",而是跨多份文档的事实综合。
2.3 Incidents(事故与故障处理)
- 2026 年 2 月 11 日:v4.7.2 固件回归导致窄通道配置下的定位漂移(localization drift),影响 14 个站点,通过回滚至 v4.7.1 在36 小时内解决
- 根因:LiDAR 外参缓存失效缺陷(LiDAR extrinsics cache invalidation bug)
- 未触发任何 SLA 罚则
对应检查点:"A February 11, 2026 firmware regression (v4.7.2) caused localization drift at 14 sites and was resolved within 36 hours with no SLA penalties." 这是一条高度具体、带有日期与版本号的事实,专门用于检验 agent 是否能在包含干扰文档的语料中精确抓取事故细节。
2.4 Supply chain(供应链)
- VLX-400 驱动单元的交货周期从22 周缩短至 14 周(在认证了第二家供应商 Shimizu Precision, Nagoya 之后)
- 单台 BOM 成本同比下降6.5%,至$19,400
2.5 Key risks tracked(关键风险跟踪)
- 客户集中风险:前三大客户占 ARR 的44%
- VLX-500 发布依赖风险:计划于 Q4 2026 发布的 VLX-500 依赖新型固态 LiDAR 模组通过-25°C 冷室认证,目前处于3 轮测试的第 2 轮
对应检查点:"Key risks include customer concentration (top 3 customers = 44% of ARR) and the VLX-500's solid-state LiDAR cold-chamber certification (in test cycle 2 of 3), which could slip the launch to Q2 2027." 从源码结构看,检查点不仅要求提到风险本身,还要求识别出其潜在后果(可能推迟至 Q2 2027),属于对文档内容的推理性综合。
三、从 Markdown 到语料库:build_corpus.py 的语料工程
build_corpus.py 是语料库的确定性构建脚本("Deterministic: running it twice produces the same corpus"),它做了三件事:
3.1 格式转换:事实文档"以真实形态发布"
- write_pdf:用
pymupdf将运营报告、董事会备忘录每页 52 行排版为 PDF; - write_docx:用
python-docx将产品简报转为 DOCX; - Markdown 文件则原样写入。
这模拟了真实企业中"运营报告是 PDF、产品简报是 Word、公司概览是 Wiki 页"的异构形态,使基准能考察 agent 的格式感知解析能力——这正是纯文本read_file方案的软肋(见第五节)。
3.2 vintage 陷阱:过期版本被评分官判为 WRONG
脚本内置了STALE_OPS_2024、STALE_OPS_2025两份旧版运营报告,写入ops/archive/目录:
- Q1 2024:1,180 台机器人、21 个站点、可用率 98.4%、单台 118 次/小时、营收 $7.9M、ARR $14.2M、前三大客户占比 61%;
- Q1 2025:1,960 台机器人、33 个站点、可用率 98.9%、MTBF 2,010 小时、131 次/小时、营收 $12.8M、ARR $27.5M、前三大客户占比 52%。
这些数字与 2026 版刻意不同。注释明确说明:"answering with the wrong vintage of a fact is penalized by the grader"——如果 agent 检索到 2025 年存档并当作最新数据引用,评分官会判定为 WRONG。这模拟了真实企业文档库中"同名报告多版本共存"的高频陷阱,是衡量 agent 时效性判断能力的关键设计。
3.3 干扰项:真实的企业文档噪声
脚本的DISTRACTORS字典包含 15+ 份与检查点事实完全无关的文档(HR 政策、IT runbook、营销日历、法务笔记、安全通告等),分布在hr/、it/、marketing/、finance/、engineering/、sales/、ops/、legal/、board/等子目录,最终形成27 个文件的完整语料,其中只有 4 份承载检查点事实。
四、混合研究基准:三臂对照与评分机制
4.1 评估的问题
基准要回答的问题是:当深度智能体需要结合私有文档 + 公开网络完成研究时,不同研究工具组合对内部事实的覆盖能力差异有多大?hybrid_benchmark.py 设计了三个对照臂:
| 对照臂 | 研究工具 | 能否看到私有语料 |
|---|---|---|
baseline | 仅 raw Tavily 网络搜索(deepagents quickstart 标配) | 不能,内部事实覆盖率恒为 0% |
baseline+files | raw 搜索 + 把 deepagents 文件工具(ls/read_file)挂载到语料副本 | 能,但需自行猜测读哪个文件、无法解析 DOCX |
gptr | GPT Researcher 的quick_search+deep_research(source="hybrid") | 能,通过 GPT Researcher 本地文档管线 |
三臂共享同一模型(默认openai:gpt-5.4)、同一系统提示词、同一任务 brief——唯一变量是研究工具链(benchmark.py 中build_baseline_agent与build_gptr_agent的对照设计)。任务为对 Veltrix Dynamics 的尽职调查简报,hybrid_benchmark.py 将检查点划分为:
- internal_checkpoints(8 条):仅在私有语料中出现的事实(融资、定价、机队、风险、事故),本文档即贡献了其中 3 条;
- web_checkpoints(4 条):真实市场事实(Geek+ 港股 IPO、Locus、Exotec),用于验证"混合模式不损失网络能力"。
4.2 评分机制与覆盖率
评分官(默认gpt-5.4)严格依据 GRADER_TEMPLATE 逐条打分,只判断报告与 ground truth 的一致性:
- CORRECT:报告陈述了检查点事实(或完全一致的细节)
- PARTIAL:提及但不完整/含糊
- MISSING:完全未提及
- WRONG:与检查点矛盾(陈旧或幻觉信息)
最终覆盖率按 coverage 计算:(CORRECT 数 + 0.5 × PARTIAL 数) / 总检查点数。这一公式对 PARTIAL 打折、对 WRONG 完全不计,确保"编造出错误数字"比"老实说找不到"更受惩罚。
五、实验结果与数据佐证
5.1 官方汇总数据
deep_agents/BENCHMARK.md 记录了 3 次运行的内部事实平均覆盖率:
| 对照臂 | 内部事实覆盖率(3 次平均) |
|---|---|
| Deep agent + raw search | 0% |
| Deep agent + raw search + 文件工具挂载语料 | 62.5% |
| Deep agent + GPT Researcher(hybrid) | 87.5%(单次最高 94%) |
同时注明:三臂的公开网络事实覆盖率基本持平(约 40–46%),说明 hybrid 模式在私有文档上的巨大增益不以牺牲网络研究为代价。
5.2 仓库中的原始运行记录
hybrid_2026-07-05_14-43-50.json 中可以看到单次运行的明细(gpt-5.4,评分官gpt-5.4):
baseline:内部覆盖率 0.0(8 条检查点 7 条 WRONG、1 条 MISSING——报告甚至断言"找不到 Veltrix 存在的证据");baseline+files:内部覆盖率 0.562;gptr:内部覆盖率0.938,web 覆盖率 0.25,延迟 180.7 秒,内部研究 API 成本仅 $0.3064。
BENCHMARK.md 还给出了机制层面的解释:DIY 文件工具方案在 27 个文件的语料上表现不稳定——必须在步骤预算内猜中要读哪个文件、纯文本读取无法解析 DOCX(产品简报事实每次运行都丢失或取到旧值)、有时会误信存档旧版本;而 GPT Researcher 的文档管线(格式感知解析 + 基于 embedding 的全语料检索)能稳定恢复内部事实。
六、在本地复现与扩展这套评估
6.1 复现命令
依据 BENCHMARK.md 与 README.md,在仓库根目录执行:
pip install -r requirements.txt -r deep_agents/requirements.txt export OPENAI_API_KEY=... export TAVILY_API_KEY=... python deep_agents/hybrid_benchmark.py --model openai:gpt-5.4 --grader-model gpt-5.4脚本会自动把DOC_PATH指向benchmark_data/internal_docs(见 hybrid_benchmark.py),运行结束后将完整记录(三份报告、逐检查点评分、覆盖率、延迟与成本)写入benchmark_results/hybrid_<时间戳>.json。若语料被改动,可随时用python deep_agents/benchmark_data/build_corpus.py确定性重建 27 文件语料。
6.2 底层机制:source 如何绑定到研究工具
hybrid 模式的技术支撑在 tools.py:build_research_tools把task.json中的source(web/local/hybrid)闭包进deep_research工具,GPTResearcher的report_source=report_source决定研究管线检索网络、本地文档还是两者并行;DOC_PATH环境变量指向本地文档目录。这正是"研究来源是任务配置、而非让 agent 每次自行决定"的设计——避免智能体为了省事绕开私有文档。日常使用时,在 task.json 中将source改为hybrid并设置DOC_PATH,即可对自有文档(PDF、DOCX、Markdown 等)执行同样的混合研究。
6.3 扩展建议
- 替换事实源:仿照
internal_docs_src/的写法,用你自己的业务文档(如真实季报脱敏版)替换四份 ground-truth,保持STALE_*旧版本与DISTRACTORS干扰项的结构不变; - 调整检查点粒度:在
hybrid_benchmark.py的internal_checkpoints中增加对单份文档细粒度指标(如本文档的 MTBF 2,340 小时、BOM $19,400)的断言,以更严苛地测试精确数字检索能力; - 增加对照臂:可仿照
build_baseline_files_agent增加"仅 local 模式"或"RAG 直连"等对照,量化不同方案的性价比。
七、事实边界与启示
需要特别强调:Veltrix Dynamics 是虚构公司,本文档及语料库中的所有财务、机队、产品数据均为基准构造物,不应被当作任何真实企业的经营事实引用。它的真正价值是方法论层面的——gpt-researcher 用一份仅 38 行的内部运营报告,加上语料工程(多格式转换、vintage 陷阱、干扰项)与三臂对照评估(hybrid_benchmark.py、benchmark.py),严谨地证明了:当研究任务需要"私有文档 + 公开网络"双源时,把 GPT Researcher 作为深度智能体的研究引擎,能恢复高达 94% 的内部文档事实,而纯网络搜索的深度智能体这一数字为 0%。这套"构造可控语料 → 固化事实检查点 → 盲评打分"的评估范式,同样适用于任何需要在真实私有数据上验证 RAG 或深度研究能力的工程团队。
【免费下载链接】gpt-researcherAn autonomous agent that conducts deep research on any data using any LLM providers项目地址: https://gitcode.com/GitHub_Trending/gp/gpt-researcher
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考