gpt-researcher
基于LangGraph的多智能体系统,自动完成从问题拆解到报告生成的完整研究流水线
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
基于LangGraph的多智能体系统,自动完成从问题拆解到报告生成的完整研究流水线
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
传统的做法是:在 Google 上搜了又搜,打开几十个标签页,一边复制粘贴一边整理文档,几个小时就这样过去了。而 GPT Researcher 的出现,像是一个不知疲倦的 AI 研究员——你丢给它一个问题,它自己规划搜索策略、抓取网页内容、提炼关键信息,最终输出一份结构完整的研究报告。
这个项目由 Assaf Elovic 创建,是一个基于 Python 的自主式多智能体研究系统。它利用 LangChain 和 LangGraph 框架,将复杂的研究任务拆解为多个子任务,由不同的 AI Agent 并行处理,再汇总成最终报告。从 2023 年上线至今,已积累超过 27,000 颗 GitHub Stars,成为 AI 研究自动化领域最具代表性的开源项目之一。
图1:GPT Researcher GitHub Stars 增长曲线(来源:star-history.com)
GPT Researcher 的核心架构建立在 LangGraph 之上——这是一个用于构建有状态、多角色 AI Agent 工作流的框架。与单一的 LLM 调用不同,它通过有向图(Directed Graph)定义 Agent 之间的协作关系,实现了任务规划、并行搜索、信息抓取、报告生成等环节的流水线化。
代码结构上,项目分为几个核心模块:
gpt_researcher/:主研究 Agent,包括 agent.py(核心智能体逻辑)、prompts.py(提示词模板)、skills/(研究/写作/策展技能集)、actions/(报告生成、网页抓取、查询处理等原子操作)multi_agents/:多智能体扩展,支持更复杂的研究工作流,可并行调度多个专业化 Agentbackend/:FastAPI 后端服务,提供 RESTful API 和 WebSocket 通信,支持 Python/CLI/前端多种调用方式frontend/:Next.js 前端界面,提供可视化的研究任务管理mcp-server/:Model Context Protocol 服务器,使 Claude 等 AI 助手可以直接调用 GPT Researcher 的研究能力数据采集层面,它支持多种检索和抓取方式:DuckDuckGo、Google、Bing 等搜索引擎,Firecrawl、BeautifulSoup、Playwright(浏览器)等多种网页抓取工具,以及 arxiv、PubMed 等学术数据库。这种多源并行采集的设计,确保了研究内容的广度和深度。
深度研究模式(Deep Research)是 GPT Researcher 的招牌功能。当用户输入研究主题后,系统会经历以下流程:首先由规划 Agent 将复杂问题分解为多个子问题;随后并行启动多个检索 Agent,从不同角度和来源搜集信息;接着对采集到的内容进行去重、排序和质量评估;最后由写作 Agent 将信息整合为结构化报告,支持 Markdown、PDF、HTML 等多种输出格式。
项目支持多种 LLM 后端:OpenAI GPT 系列是默认选项,但通过 llm_provider/ 模块,用户也可以接入 Claude、Azure OpenAI、本地 LLM(如 Ollama)等任意兼容 LangChain 的模型。Tavily AI 作为专用搜索 API 提供商,是官方推荐的检索后端;用户也可以选择免费的 DuckDuckGo。
报告类型也相当丰富:标准深度报告、简洁报告、每个子主题的独立报告、带网络引用的来源报告等。最新版本(v0.14.7)还支持内嵌图片生成——通过 Google AI 生成与报告内容匹配的图片,提升可读性。
GPT Researcher 提供了完整的容器化部署方案,是本次分析中部署支持评分最高的项目之一:
Dockerfile 采用多阶段构建(multi-stage):第一阶段安装 Chromium、Firefox 等浏览器环境及其驱动;第二阶段使用轻量级的 python:3.12-slim-bookworm 基础镜像,最终镜像大小可控。docker-compose.yml 则一键拉起前后端服务,用户只需配置好 OPENAI_API_KEY 等环境变量即可运行。
对于本地开发,项目使用 Poetry 管理依赖,pyproject.toml 清晰定义了所有版本约束。要求 Python 3.11+,依赖列表中包含了 langchain、langgraph、fastapi、duckduckgo_search、beautifulsoup4 等主流库。.env.example 提供了完整的配置说明文档,降低了上手门槛。
硬件需求方面,作为纯 CPU 运行的研究工具,不需要 GPU,但建议 4GB+ RAM 以支持多浏览器实例并发运行。
GPT Researcher 还提供了 MCP Server 实现,将研究能力接入支持 Model Context Protocol 的 AI 助手(如 Claude Desktop)。这意味着你可以在 Claude 的对话中直接发起深度研究任务,由 GPT Researcher 在后台完成搜索和报告生成。这是一种优雅的"AI 帮 AI"的工作模式,代表了 AI Agent 互联互通的未来方向。
尽管功能强大,GPT Researcher 也存在一些局限性。首先,它高度依赖外部 API——OpenAI API、Tavily API 等都是付费服务,大规模研究任务的成本不可忽视。其次,网络抓取的稳定性是长期痛点:目标网站的结构变化、反爬虫机制、网络波动都会影响研究质量,需要持续维护抓取适配器。第三,报告的"AI 味"较重,在引用准确性和事实核查方面仍需要人工把关——这也是当前所有 LLM 生成内容的共同挑战。
GPT Researcher 的出现,填补了"AI 写代码"与"AI 做研究"之间的空白。它展示了一条可行的路径:如何将复杂的信息处理任务,分解为由多个专业化 Agent 协作完成的流水线。随着 Claude、GPT-5 等更强推理模型的普及,这类工具的输出质量还将持续提升。
从增长曲线看,该项目自 2023 年上线以来保持稳健增长,社区活跃度高(216 个 open issues,3,666 个 forks),MCP 集成等新功能持续迭代。对于需要系统性研究能力的企业和个人而言,它是一个值得深入探索的生产力工具。
分析时间:2026-05-25 | GitHub Stars: 27,273 | Language: Python | License: Apache-2.0