GPT Researcher 怎么用?从安装到出报告的新手快速上手指南
【免费下载链接】gpt-researcherAn autonomous agent that conducts deep research on any data using any LLM providers项目地址: https://gitcode.com/GitHub_Trending/gp/gpt-researcher
GPT Researcher 是一个自主研究代理(autonomous research agent),你给它一个课题,它自己拆解问题、联网搜集资料、读取本地文档,最后产出一份带引用来源的结构化报告。如果你要写文献综述、做市场调研或盯竞争对手动态,它可以把最耗时的"找资料"环节压缩到几分钟。
5 分钟跑通第一次研究
环境要求 Python 3.8+ 和 pip。建议先建一个虚拟环境隔离依赖:
python -m venv venv source venv/bin/activate # Windows 用 venv\Scripts\activate然后按你的习惯二选一安装:
- 直接装包:
pip install gpt-researcher - 从源码装:
git clone https://gitcode.com/GitHub_Trending/gp/gpt-researcher cd gpt-researcher pip install -r requirements.txt装好后配密钥:把 .env.example 复制成.env,填入OPENAI_API_KEY(或其他 LLM 密钥)和你计划用的搜索引擎密钥,例如TAVILY_API_KEY。
再写一个最小脚本:
from gpt_researcher import GPTResearcher researcher = GPTResearcher(query="人工智能的最新发展") print(await researcher.conduct_research())跑通后你手里会有一份 Markdown 报告。到这一步,安装和配置就算完成了。
三种报告模式怎么选
同一个report_type参数,决定研究的深度:
| 模式 | 适合场景 |
|---|---|
research_report | 默认模式,快速摸清一个主题的全貌 |
detailed_report | 需要按子主题展开的深入分析,如行业研究 |
deep_research | 学术级全面调查,如论文综述 |
初始化时指定即可:
GPTResearcher(query="机器学习在医学影像分析中的应用", report_type="deep_research")拿不准就从默认的research_report开始,觉得覆盖不够再加深,避免一开始就为深度研究付出更高的 token 成本。
把范围收窄:指定来源与域名
默认情况下它会在公开网络上搜索。如果你只信任特定网站,可以用query_domains限制搜索范围:
GPTResearcher( query="2025年人工智能市场趋势", report_type="detailed_report", query_domains=["statista.com", "gartner.com"], )另外两个参数按需求选用:
source_urls:直接给一批 URL,只基于这些网页写报告;subtopics+max_subtopics:自己定好子主题列表,并控制数量上限。
域名过滤和来源指定对"竞争情报"这类任务特别有用——只盯对手的官网和公告页,报告就不会跑偏。
混合研究:本地文档 + 网络一起查
如果你手上已经有内部 PDF、产品手册或过往报告,不必二选一。GPT Researcher 支持混合研究(hybrid research):把本地文档和网络搜索结果放进同一个上下文,再统一生成报告。
混合模式下,report_source传hybrid,本地文档通过 document/ 目录下的加载器读入。典型用法:让模型先消化你的内部材料,再用最新行业动态补充,最后产出一份"既有内部视角又有外部数据"的报告。
想看它怎么分工:多代理协作
复杂任务在内部会拆给多个代理协作:researcher 负责搜集、writer 负责撰写、reviewer 负责审核,流程由 LangGraph 编排,代码在 multi_agents/ 目录,各角色定义在 multi_agents/agents/。
你平时不需要动这些代码,但了解分工有助于排障——报告里某段质量差,往往能对应到某个代理的环节。
避坑:新手最常踩的 3 个坑
- 报告为空或搜索失败:先检查
.env里密钥是否写对、用的搜索引擎是否和密钥匹配。换搜索引擎时改RETRIEVER环境变量即可,可选引擎在 retrievers/ 下都有对应实现。 - API 调用被限流:调低并发、给请求加延时,相关参数集中在 配置目录,改
default.py或写进.env都行。 - 成本超预期:报告越深、子主题越多,token 消耗越大。先用默认模式跑小题目,确认流程没问题再上大课题。
更多细节可以看 文档目录 里的使用指南和示例。
下一步建议
- 先按第一节装好、配好密钥,用一个你正在跟进的真实课题跑
research_report,看看报告质量再决定是否升级到detailed_report。 - 手上有内部材料的,直接试混合模式:加一个
report_source="hybrid",把本地文档喂进去,感受差别。
【免费下载链接】gpt-researcherAn autonomous agent that conducts deep research on any data using any LLM providers项目地址: https://gitcode.com/GitHub_Trending/gp/gpt-researcher
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考