DeepClaude
双模型协同 API 网关,DeepSeek r1 推理 + Claude/Gemini 生成,一次调用完成
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
双模型协同 API 网关,DeepSeek r1 推理 + Claude/Gemini 生成,一次调用完成
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
DeepClaude 是一个将「推理模型」与「生成模型」串联组装的 API 聚合层:DeepSeek r1 负责规划推理,Claude 3.7 Sonnet / Gemini 2.5 Pro 负责内容生成,一次请求获得双模型协同的输出结果。
2025 年初,AI 编程工具 Aider 发布了一项研究,发现 DeepSeek r1 与 Claude 3.5 Sonnet 的组合效果显著优于单独使用任何一个模型。其核心思路是:让擅长推理的模型先「想清楚」,再让擅长生成的模型「写出来」。
作者 ErlichLiu 受此启发,开发了 DeepClaude——一个专门实现这类「双模型协同」的系统。与简单的模型选择不同,DeepClaude 在单次 API 调用中自动串联两个模型,让上游推理结果无缝传递给下游生成器,开发者无需关心内部流程,只需像调用普通 OpenAI API 一样发送请求。
DeepClaude 的架构可以概括为:FastAPI 网关 + 模型编排层 + OpenAI 兼容协议。
后端采用 Python 3.11 + FastAPI 构建轻量 HTTP 服务,通过 aiohttp 异步调用上游 DeepSeek / Claude / Gemini API。路由层完全兼容 OpenAI Chat Completions 格式(/v1/chat/completions),这意味着任何支持 OpenAI API 的客户端(如 Cherry Studio、Dify、AnythingLLM)都可以零成本接入。
模型编排逻辑在 app/manager/model_manager.py 中实现。系统从 model_configs.json 读取配置,支持同时定义多个「双模型组合」:代码生成推荐 DeepSeek r1 + Claude Sonnet,内容创作推荐 DeepSeek r1 + Gemini 2.5 Flash/Pro。组合 prompt 由项目内置,衔接自然。
前端是一个独立的静态 Web 界面(frontend/),提供图形化配置面板。1.0 版本后,用户无需编辑 .env 文件,通过浏览器即可配置 API Keys、选择模型组合、开关各项参数,并支持配置的导入导出。
1. 双模型协同推理
DeepClaude 支持两种模式:流式(streaming)和非流式。当 stream: true 时,系统以 SSE 格式实时推送双模型的协作过程;当 stream: false 时,等两个模型全部处理完毕后一次性返回完整结果。非流式模式对 Dify 等工作流编排工具更友好,项目专门做了适配。
2. OpenAI 全兼容 API
除了 /v1/chat/completions,项目还实现了 /v1/models(列出可用模型)、/v1/config(读写配置)、/v1/config/export 和 /v1/config/import(配置迁移)等端点。API Key 验证通过 verify_api_key 中间件实现,可自定义配置页面访问无 Key 限制(/config),方便初始设置。
3. 成本控制优化
项目内置多项成本优化措施:DeepSeek r1 的 max_tokens 可自定义调整,减少无意义输出;Gemini 2.5 Flash 的思考过程可关闭,节省 tokens;针对 Gemini 2.5 Pro 的专属 prompt 优化,平均每次请求可节省 30% tokens 消耗。此外,支持按模型配置代理(proxy),避免不必要的跨境流量费用。
4. 跨域与错误处理
CORS 配置灵活可调,支持通过环境变量或配置文件设置允许的来源。错误处理是项目亮点之一:对于上下文超限、参数无效等常见错误,系统会返回中文友好提示,且在流式请求中也能正确传递错误信息到客户端。
DeepClaude 提供两条部署路径:Docker 一键部署(推荐)和手动安装。
Docker 方式只需三步:git clone → docker-compose up -d → 访问 http://localhost:8000/config 配置 API Keys。Docker 镜像支持多平台(amd64/arm64),可通过 docker pull erlichliu/deepclaude 直接拉取。配置文件通过 volume 挂载到宿主机,重启容器不会丢失配置。
手动安装需要 Python 3.11+,通过 pyproject.toml 安装依赖后运行 uvicorn app.main:app,适合已有 Python 环境的开发者。
内存占用极低(512MB 即可运行),无需 GPU,非常适合在树莓派、轻量 VPS 或内网服务器上长期部署。
/v1/models 接口尚未实现精确的 tokens 消耗统计,对于需要成本管控的企业用户这是一个已知缺口。DeepClaude 代表了一个有趣的实践方向:组合推理(Reasoning)+ 生成(Generation) 正在成为 2025 年 AI 应用的主流范式。相比于单纯追求「更强的基础模型」,DeepClaude 证明了一个合理的模型组合可以在成本可控的前提下实现更稳定的输出质量。
项目在 GitHub 获得近 3000 stars,说明社区对这类「模型编排层」有真实需求。随着 o1、DeepSeek r1 等推理模型能力增强,未来会有更多类似的双模型协同工具出现,而 DeepClaude 率先在这个方向上验证了产品化的可行性。

图1:DeepClaude GitHub 仓库社交预览图