PhD-Zero
TenureAI/PhD-Zero加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
2026年3月,一个名为"PhD-Zero"的 GitHub 仓库悄然上线。没有隆重的发布会,没有铺天盖地的媒体报道,却悄然吸引了全球 AI 研究者的目光——它的目标,是给大语言模型(LLM)装上一套"博士级"的研究思维框架。
想象一下:一位刚刚入门的博士生,面对一道全新的研究课题,最怕的是什么?——不是不会做实验,而是不知道"从哪里开始"。文献调研怎么做?实验方案怎么设计?上下文怎么管理?什么时候该停下来请教导师?这些问题,往往需要一个资深研究者花数年时间才能慢慢领悟。而 PhD-Zero 想要做的,就是把这种"隐性知识"变成一套可复用的 AI Agent 工作流,让任何 AI 都能像经验丰富的研究者一样系统性地开展研究。
PhD-Zero 的设计哲学在 README 第一段就已点明:"The point is not to make an agent sound smart for one turn. The point is to give it a workflow it can actually follow."(目标不是让 agent 在单轮对话中"显得聪明",而是给它一套真的能执行的工作流。)
这一理念直击当前 AI Agent 领域的一个核心痛点:现有 Agent 在执行简单任务时表现出色,但一旦涉及需要多步骤、跨周期、强推理的研究任务时,往往会出现"上下文丢失"、"实验结果不可追溯"、"论文写作不规范"等问题。PhD-Zero 的解决思路是:不要让 Agent 自由发挥,而是用结构化的 Skill 技能库约束它的行为路径。
PhD-Zero 提供了一套完整的 9 项技能,涵盖研究工作的全生命周期:
1. research-workflow(研究编排器):作为主控技能,协调所有其他技能的调用顺序。它定义了标准研究流程的执行顺序:先初始化运行环境 → 再收集上下文 → 然后深度调研 → 制定计划 → 执行实验 → 撰写报告。所有的子技能都通过它来调度,避免了 Agent 随意调用导致的工作流混乱。
2. deep-research(深度调研):当用户输入包含研究意图关键词(如"调研""分析""为什么""可行性"等中英文词汇)时,该技能必须被触发。它会进行系统性文献搜索、证据收集、信息验证,并保留完整的查询轨迹供审计使用。设计上特别强调"证据优先"——不允许 Agent 仅凭猜测输出结论。
3. experiment-execution(实验执行):负责运行、恢复、监控实验的全流程,包含启动检查清单和远程信息模板。支持后台执行,Agent 在实验运行期间可以并行处理其他任务。
4. paper-writing(论文撰写):提供完整的学术论文写作框架,涵盖摘要、引言、方法、实验、相关工作等章节的模板指引。能自动从 arXiv 获取参考文献格式。
5. memory-manager(记忆管理):用 SQLite 数据库管理 Agent 的长期记忆,将记忆分为 procedure(流程知识)、episode(经验记录)和 insight(洞察发现)三类。在长时间研究任务中,这个技能确保 Agent 不会"失忆"——它会在每次任务开始时检索历史记忆,在任务结束时写入新的经验。
6. project-context(项目上下文):在实验执行前解析运行时环境信息,确保 Agent 了解当前代码库的结构和状态。
7. human-checkpoint(人工审核点):在涉及安全风险、高资源消耗或硬性障碍的决策点,强制触发人工确认。这是对 Agent 自主决策的一道安全阀。
8. run-governor(运行治理):设置运行模式和 run_id,管理研究任务的生命周期。
9. research-plan(研究计划):在 deep-research 完成后生成详细的研究计划,包含消融实验设计和执行路线图。
PhD-Zero 的一个重要设计亮点是跨运行时兼容性。同一套 Skill 技能库,会同步暴露给不同的 Agent 运行时:OpenAI Codex 系列 agent 从 AGENTS.md 读取工作区规则,Claude Code agent 从 .claude/skills/ 发现镜像层。真正的"真相之源"(source of truth)统一放在 .agents/skills/ 目录下,其他层只是符号链接。
这样做的好处显而易见:无论团队使用哪种 Agent 工具,都能受益于同一套研究方法论,而无需为不同工具重复维护技能库。
README 中展示了两个令人印象深刻的端到端演示案例:
第一个案例中,PhD-Zero 自主研究了不同提示词技巧(Prompting Tricks)对模型推理能力的影响——从文献调研、实验设计,到执行控制变量实验、分析结果,再到最终撰写完整研究报告,全部由 Agent 独立完成。
第二个案例更加震撼:PhD-Zero 在 AIME25(美国数学邀请赛 2025 年题目)基准集上,系统性地优化 Qwen3-1.7B-base 模型。它尝试了多种数据集(numina-math、open-r1)、不同训练算法(SFT、RL),探索了学习率调优、数据过滤等调参技巧,最终将模型的 AIME25 准确率从 0% 提升到了 20%。对于一个 1.7B 参数的小模型而言,这是一个相当可观的成绩。
项目代码 100% 为 Python(约 69,830 字节),采用纯文本 YAML 配置(agent 路由规则)和 SQLite 数据库(记忆存储),没有任何重型依赖。这种"轻量化"设计让 PhD-Zero 可以轻松集成到各种 Agent 运行环境中,不会额外增加系统的复杂性。
代码结构高度模块化:每个 Skill 都是一个独立的目录,包含 SKILL.md(技能定义)、agents/(运行时配置)、references/(模板和参考文档)和 scripts/(辅助脚本)。这种结构既便于维护,也便于社区贡献新的技能。
必须指出的是,PhD-Zero 也面临一些现实挑战:
1. 无容器化支持:项目中没有 Dockerfile 或 docker-compose,无法通过容器一键部署。对于想要快速尝鲜的开发者而言,需要手动配置 Agent 运行环境。
2. 依赖外部 Agent 运行时:PhD-Zero 本质上是一套"方法论"而非独立应用,它必须运行在 Claude Code 或 OpenAI Codex 等 Agent 平台上才能发挥作用。用户需要具备一定的 Agent 使用经验。
3. 研究质量依赖底层模型能力:虽然 PhD-Zero 提供了规范的工作流,但如果底层的 LLM 推理能力不足(如数学证明、代码调试等),最终的"博士级"输出质量仍然会受限。
4. 记忆持久化需要额外配置:memory-manager 的 SQLite 数据库需要用户自己维护存储路径,暂无云端同步能力。
5. 图片资源访问受限:GitHub CDN 在部分网络环境下不可访问,影响文档的可读性体验。
PhD-Zero 的出现,标志着 AI Agent 研究社区正在从"开发更好的工具"转向"构建更规范的方法论"。在此之前,大多数 AI Agent 项目关注的是"如何让模型更快、更强",而 PhD-Zero 试图回答一个更根本的问题:"如何让 AI Agent 像专业研究者一样系统性地思考和工作?"
从增长曲线来看,项目于 2026 年 2 月 27 日创建,截至 7 月 24 日已获得 51 颗星、4 个 Fork,并在不到 5 个月内积累了完整的 9 项技能体系。这个速度在纯研究导向的 Agent 项目中相当可观,说明社区对"结构化 AI 研究工作流"的需求是真实存在的。
推荐使用:AI 研究团队(想让 Agent 承担更多系统性研究任务)、高校实验室(探索 AI 辅助科研的可能性)、Agent 开发者(借鉴多运行时 Skill 架构设计)。
不太适合:纯应用开发者(没有 Agent 运行需求)、需要开箱即用 Web 界面的用户(非应用类产品)。
上手建议:先克隆仓库,运行 find .agents/skills -mindepth 1 -maxdepth 1 -type d 确认技能目录完整;然后在 Claude Code 或 Codex 中引入 AGENTS.md,按照文档中的 Quick Start 配置工作流。