claude-octopus
让8个AI模型协作审查代码,用共识门控消除单模型盲区,提升开发质量
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
让8个AI模型协作审查代码,用共识门控消除单模型盲区,提升开发质量
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
你有没有过这样的经历:花了一整天写的代码,自测通过,PR 也合了,结果上线第二天被用户发现了一个「低级bug」——比如边界条件没考虑到,或者某个 API 用法其实已经 deprecated 了。这种「灯下黑」几乎是每个开发者的噩梦。
Claude Octopus 解决的正是这个问题:不给单一 AI 模型留盲区。它是一个多 AI 协作框架,可以在每一次代码任务中调动最多 8 个不同的 AI 模型(Claude、Codex、Copilot、Qwen、Gemini、Ollama 等)同时参与,各自从自己的角度审视代码,最后通过「75% 共识门控」机制,只有当多数模型认可时,问题才会被放行。简单说,它让 AI 之间互相「挑刺」,而不是只有一个 AI 说了算。

图1:Claude Octopus 多模型协作工作流演示——多 AI 提供商同时参与辩论和研究
2025 年,Claude Code、GitHub Copilot、OpenAI Codex 等 AI 编程工具已经深度融入开发者日常工作。但与此同时,一个问题也逐渐暴露出来:每个模型都有自己的知识盲区。Claude 可能对某些新出的 Python 框架了如指掌,但对前端构建链路不太熟;Codex 可能精于代码补全,却容易忽略安全漏洞。单一模型即使再强,也只是「一个视角」。
Claude Octopus 的作者 nyldn 从这个痛点出发,在 2026 年 1 月正式发布了这个项目,核心理念来自 Double Diamond(四象限)设计方法论——先发散探索,再收敛决策。与其让一个 AI 闷头干,不如让多个 AI 先各自「辩论」一圈,再形成结论。这个思路在软件工程领域其实有深厚的实践基础:结对编程(Pair Programming) 本质上也是为了让两个视角相互碰撞,只是 Octopus 把这个「对」升级成了「八对」。
项目发布后迅速在 GitHub 获得关注,目前已有超过 3400 颗星,310 个 fork,被 12 个 topics 标记,包括 ai-agents、multi-llm、claude-code-plugin 等高价值标签。社区讨论活跃,官方维护着 Reddit 频道 r/ClaudeOctopus。
如果把一个开发团队比作一家餐厅,单一 AI 编程工具就像只有一个厨师的厨房——厨师再厉害,也可能在某个菜系上不够精通,或者连续工作太久之后开始犯困。 Claude Octopus 则像是给厨房配了一支AI 纠察队:主厨(Claude Code)负责日常出餐,但每当有重要新菜式(重要功能/代码)上桌之前,会有二厨(Codex)、糕点师(Gemini)、营养师(Ollama)同时尝味,任何一个人发现问题,这道菜就必须返工。
关键区别在于「共识门控」。不是任何一个 AI 说「有问题」就阻止代码通过,而是要求多数 AI 都认为没问题才放行——这避免了「过度谨慎」的单一 AI 无限提问,也避免了「过度自信」的 AI 草率放行。75% 这个阈值,恰好在「谨慎」和「效率」之间找到了平衡点。
Claude Octopus 提供的不只是几个孤立的命令,而是一套四阶段工作流(Double Diamond):
| 阶段 | 描述 | 典型命令 |
|---|---|---|
| Discover | 发散探索:多 AI 模型同时研究问题背景、技术选型 | /octo:research |
| Define | 收敛定义:汇总研究结论,确定问题边界 | /octo:council |
| Develop | 迭代开发:多 AI 协作编写代码,含测试 | /octo:tdd |
| Deliver | 交付验证:最终审查、安全扫描、合规检查 | /octo:review |
/octo:council 是 v9.41 新增的核心功能,这是一个结构化多 AI 协商模块,支持 3/5/7 人「议会」模式。你可以选择不同的目标模式(advice、decision、plan、implement、review)和协商风格(balanced、adversarial、red-team、executive),模型们会在「仲裁者」角色下展开论证,最终通过「法定人数门控 + 关键否决权」机制输出结论。
/octo:factory 则更进一步,实现「规范进、软件出」的自动化流水线——你给一个功能描述,它自动跑完整个 Discover-Define-Develop-Deliver 流程,最终产出可直接 review 的代码。
除此之外,还有 50+ slash 命令:review(代码审查)、debug(调试)、security(安全扫描)、prd(产品需求文档)、deck(幻灯片生成)等,以及 54 个可复用技能模块,涵盖架构审计、UI/UX 设计、内容流水线等场景。
从代码结构来看,Claude Octopus 是一个高度模块化的多插件架构:
agents/:存放 agent 配置文件,分为 droids(自动化执行代理)、personas(角色定义)、principles(行为准则)skills/:技能模块库,包含 flow-discover/develop/define/deliver 四大流程模块,以及针对不同场景的专项技能(如 skill-security-audit、skill-code-review)config/:配置层,分为 providers(AI 提供商配置)、workflows(工作流定义)、templates(模板)、blind-spots(各模型的已知盲点数据库)mcp-server/:Model Context Protocol 服务端,用于对接 Cursor IDEopenclaw/:自定义 agent 框架bin/:命令行工具,包括 token 压缩(octo-compress)等实用脚本支持最多 8 个 AI 提供商:Claude(主力)、Codex(OpenAI)、Copilot(GitHub)、Qwen(阿里,免费额度高)、Gemini(Google)、Ollama(本地部署)、Perplexity(搜索增强)、OpenRouter(聚合)。零配置即可启动——只要安装了 Claude Code,所有功能立即可用,其他提供商按需逐步添加。
技术栈:主体是 Shell(用于 orchestrating scripts)和 TypeScript/Node.js(mcp-server、package.json 管理),没有 Python 依赖,目标是纯前端工具链定位。

图2:Claude Octopus 项目社交预览图
对 Claude Code 用户来说,上手几乎是零门槛的:
claude plugin marketplace add https://github.com/nyldn/plugins.git
claude plugin install octo@nyldn-plugins
/octo:setup
一条命令装好,自动检测环境,显示缺少哪些提供商,然后引导配置。整个过程不需要写任何代码,适合已经习惯在终端工作的开发者。
对非 Claude Code 用户(Cursor、OpenCode、Codex CLI),需要额外配置 MCP server 或插件安装,略有一些门槛。特别是 Cursor 用户,需要手动配置 mcp.json,安装 npm 依赖,还要配置 API key 环境变量——这对于非技术用户来说可能有些困难。
Cloud/Remote 场景:v9 之后支持 OCTOPUS_REMOTE_SESSION 环境变量,用于远程/托管环境,自动跳过 provider smoke test,适配 CI/CD 和定时任务场景。
Claude Octopus 固然强大,但也有几个值得关注的局限:
共识门控的代价是成本翻倍:8 个模型同时跑,单次任务的 token 消耗可能达到单个模型的 5-8 倍。对于预算敏感的小团队,这是一笔不小的成本。
非 Claude Code 平台的体验存在割裂:目前最佳体验只存在于 Claude Code(插件模式),其他 IDE 的 MCP 集成功能相对有限,社区文档也以 Claude Code 为中心。
容器化支持为零:项目没有 Dockerfile 和 docker-compose,无法在 Docker 环境中快速部署——这与当前「一切皆容器」的 DevOps 趋势有些脱节,不适合想要在服务器上静默运行自动化任务的场景。
依赖外部 API 稳定性:虽然有 circuit breaker 和自动恢复机制,但 8 个提供商中任何一个出现可用性问题,都可能影响最终结论的质量。
Claude Octopus 的出现,标志着 AI 编程工具正在从「单兵作战」向「协同作战」演进。它不是要替代 Claude Code 或 Copilot,而是在其上增加了一层多模型协作层——就像 VS Code 本身不是编译器,但通过插件生态让开发体验大幅提升一样。
从增长曲线看,项目从 2026 年 1 月发布到 6 月已获得 3400+ stars,310 forks,增长速度在同类项目中处于头部。更值得关注的是其 ai-agents、multi-llm、claude-orchestration 等标签的组合——这些标签指向的趋势是:未来的 AI 编程不会是单个强模型包打天下,而是多个专业化模型各司其职、协同决策。
Claude Octopus 正在这个方向上做最有深度的实践。