
GPT Researcher 快速指南如何搭建一个会自主搜索、输出带引用研究报告的深度研究代理【免费下载链接】gpt-researcherAn autonomous agent that conducts deep research on any data using any LLM providers项目地址: https://gitcode.com/GitHub_Trending/gp/gpt-researcherGPT Researcher 是一款开源的自主深度研究代理deep research agent。你只需给它一个研究问题它会自动拆解子问题、并行搜索网页和本地文档、筛选聚合 20 多个信息源最终产出一份带引用链接的结构化研究报告。读完本文你能在 10 分钟内跑起一个带界面的研究服务并知道如何按自己的场景定制报告来源、语气和深度。 快速上手三步跑通第一条研究报告先让它在浏览器里动起来建立正反馈后再谈原理。第一步拿到代码。克隆仓库并进入目录git clone https://gitcode.com/GitHub_Trending/gp/gpt-researcher cd gpt-researcher这条命令把整个项目包括前端、后端和核心库下载到本地。第二步配两个密钥。创建一个.env文件写入你的 LLM 密钥和搜索 API 密钥官方推荐 OpenAI Tavily其他提供商也可以OPENAI_API_KEY你的OpenAI密钥 TAVILY_API_KEY你的Tavily密钥这两行决定了大脑用哪家 LLM和眼睛用哪个搜索引擎是整个项目最少但必须的配置。第三步装依赖并启动pip install -r requirements.txt python -m uvicorn main:app --reload启动后打开浏览器访问http://localhost:8000输入一个研究问题比如AI 对远程办公的影响几分钟后你就能看到一份带引用的 Markdown 报告并且可以导出为 PDF 或 Word。如果你不需要 Web 界面只想要一条命令行出报告项目根目录提供了 cli.pypython cli.py 气候变化的主要成因 --report_type research_report报告会自动保存到outputs目录research_report是约 2 分钟的快速摘要型detailed_report是约 5 分钟的深入型二选一即可上手。 工作原理编辑部模式的计划-执行架构把它想象成一个小型新闻编辑部而不是一个会搜索的聊天框。策划Planner拿到你的研究问题后先生成一组合在一起能形成客观结论的子问题。这一步直接决定了报告覆盖面。采编执行代理每个子问题分派给一个爬虫代理并行抓取网页、摘要内容并记录来源。并行化是它比单线程搜索快得多的原因。主编Publisher把所有子主题的摘要去重、聚合写成一份连贯的报告每个论点都挂上出处。上图展示了规划环节研究问题被拆分成一组互补的子问题再交给各自的搜索代理这套先规划、后执行、再聚合的设计受 Plan-and-Solve 思路启发带来两个实际好处一是多源交叉让单个网站的错误或偏见被稀释二是子任务并行速度接近1 个问题的耗时。核心逻辑都集中在 gpt_researcher/ 目录各搜索源实现在 gpt_researcher/retrievers/内置了 Tavily、Google、Bing、DuckDuckGo、ArXiv 等二十余种检索器。 典型用法按需求选择三条研究路径同一条流水线换几个参数就是三种用法。下面每条路径对应一个真实场景。路径一网页研究 前端实时跟踪默认路径就是快速上手里跑起来的那个界面。适合我要一份随时可查的行业综述的场景提交问题后界面会实时展示正在规划 → 正在搜索 → 正在撰写的阶段进度报告支持继续追问Chat相当于给报告开了个讨论区。路径二本地文档研究——让代理只读你的资料如果你有内部知识库PDF、Word、Excel、Markdown 等可以指定代理只在这些文档上做研究不碰网络。只需两步export DOC_PATH./my-docs然后在界面下拉框选 My Documents或在代码里传report_sourcelocal。更常见的是混合模式本地文档打底 网络搜索补充两边来源都会进入报告的引用列表。上图展示混合研究流程本地文档与网络来源在同一研究任务中并行处理这个模式很适合基于公司历史材料写竞品分析这类既要内部事实、又要外部动态的任务。路径三Deep Research 递归深研把报告类型设为deep代理会切换成树状探索每个层面向外铺开多条子研究线再沿线索逐层下钻并发执行、自动聚合上下文。一次约 5 分钟、成本约 0.4 美元按官方基准产出接近人工深度调研的信息密度。想理解它的参数广度deep_research_breadth、深度deep_research_depth可以看深度研究文档或示例目录 backend/report_type/deep_research/。⚙️ 定制与接入把研究代理变成你的专属工具控制信息来源域名过滤传一个domains列表搜索就被限定在你信任的站点内例如只看 forbes.com 和 techcrunch.com。做法和更多接口见域名过滤文档。指定具体 URLsource_urls可以让代理只围绕你给的网页做研究再加complement_source_urlsTrue允许它顺藤摸瓜找相关页面。自定义报告指令用custom_report类型把query直接写成一句完整指令比如用 APA 格式写一份综述并附来源报告的版式和侧重点都听你的。以上三项集中在定制研究文档里有完整示例。换搜索源不换代码改.env里的RETRIEVER就能切换搜索引擎tavily、google、bing、duckduckgo等本地模型则通过OPENAI_BASE_URL指向任何 OpenAI 兼容接口。搜索与模型解耦是它适配私有部署的关键设计。接入多代理流水线想要更重的研究流程multi_agents/ 提供了一整套基于 LangGraph 的分工团队规划、研究、撰写、事实核查、编辑、发布各司其职还能接入人工审核节点一次运行通常产出 5–6 页、多格式PDF/Docx/Markdown的报告。上图是多代理协作架构研究、写作与事实核查由不同代理接力完成接入自己的数据源MCP设置RETRIEVERtavily,mcp并传入mcp_configs代理就能同时访问 GitHub 仓库、数据库等 MCP 数据源实现网络 私有数据的混合研究MCP 文档有完整配置说明。️ 避坑与调优常见问题一次讲清跑起来但报告质量差九成是搜索源问题。Tavily 免费额度小、DuckDuckGo 无需密钥但结果质量波动大——优先给报告质量敏感的查询配一个稳定的商业搜索 API。想换 LLM 提供商所有模型相关行为由LLM_PROVIDER与环境变量控制默认配置集中在 gpt_researcher/config/variables/default.py改环境变量即可不必动代码。并发与速度子问题默认并发抓取Deep Research 的并发上限由DEEP_RESEARCH_CONCURRENCY控制遇到搜索 API 限流时优先降并发而不是降数量。看不清代理在干什么两个手段一是把 LangChain 追踪打开LANGCHAIN_TRACING_V2true API Key每个 LLM 调用、每步代理状态都能在 LangSmith 面板里回放二是项目自带日志系统运行日志落在logs/目录日志细节见日志文档。成本预期普通详细报告消耗有限Deep Research 约 0.4 美元/次o3-mini high 推理。批量跑评测前先小样本试水。上图是在 LangSmith 中查看研究代理执行链路的效果便于定位慢在哪一步 深入与延伸下一步去哪里入门文档从官方文档首页进入覆盖安装、配置、Docker 部署Linux 部署指南。示例代码docs/docs/gpt-researcher/examples/ 下有自定义提示、样本报告、纯来源输出等可直接运行的脚本。想读懂内部核心入口是 gpt_researcher/agent.py配合 gpt_researcher/prompts.py 就能看到每一步喂给 LLM 的提示词是最快的源码阅读路线。想做评测evals/ 提供了 SimpleQA 等基准的现成脚本deep_agents/benchmark_results/ 里还有历次基准跑出的数据可以对照你自己的结果做回归。想玩更多形态仓库内还有 NextJS 前端frontend/nextjs/、轻量静态前端frontend/和 Docker 一键全栈方案docker-compose.yml按团队需要取用即可。从一条python cli.py到一条多代理发布流水线GPT Researcher 的能力上限取决于你愿意定制到哪一层——而每一层的改动都不超过改一个环境变量。【免费下载链接】gpt-researcherAn autonomous agent that conducts deep research on any data using any LLM providers项目地址: https://gitcode.com/GitHub_Trending/gp/gpt-researcher创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考