corpusos
统一六大AI框架的协议层基础设施,一套代码通吃LangChain/LlamaIndex/AutoGe
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
统一六大AI框架的协议层基础设施,一套代码通吃LangChain/LlamaIndex/AutoGe
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。

图1:Corpus OS 项目概览
你有没有过这样的经历:花了一周时间在 LangChain 里搭好了一个 RAG 流程,产品经理突然说「我们改用 LlamaIndex 做数据索引吧」。然后?重写一遍。换个 embedding 模型?再重写一遍。团队协作时,AutoGen 的同事和 Semantic Kernel 的同事各写各的 adapter,谁都整合不到一块儿。
这不只是你的问题——据 Corpus OS 团队估算,全球有约 50 万开发者正被这种「框架孤岛」困住,每次切换框架或模型都要重写集成逻辑。
Corpus-OS/corpusos 就是来解决这个问题的。这是一个完全开源(Apache-2.0)的协议套件,用一套统一的规范同时标准化 LLM、向量数据库、图数据库和 Embedding 生成四类基础设施操作,让你在任何一个框架里写的代码,换到另一个框架几乎不用改。
Corpus OS 的创始故事颇为有趣。创始人 Appo Agbamu 此前一直在金融领域工作,曾用 FIX 协议构建交易执行、清算和结算系统,也用 ISO 20022 构建过支付和银行基础设施。这些领域的特点是什么?——协议先行:不同银行、不同系统只要遵循同一套协议,就能无缝通信。
后来他转战 AI 领域,在 Ahrvo Network 构建基于 LLM、向量数据库、图数据库和 Embedding 服务的系统时,发现 AI 行业恰恰缺少这样的协议层。每次换一个模型提供商,就要重写一遍集成代码;换一个框架,整个架构要推倒重来。于是他决定:不如把金融行业成熟的做法搬过来——先定协议,再做实现。
2026 年 2 月 10 日,Corpus OS 正式发布了 v1.0.0 规范和配套的 SDK 包,吸引了《Bergen Record》《Progress Index》等媒体的关注报道。
Corpus OS 的设计哲学是「wire-first」(协议先行),而不是「wrapper-first」(封装优先)。它先定义好每个操作的请求/响应格式、错误分类和指标模型,然后才提供各框架的适配器实现。

图2:Corpus OS 架构图 — 应用层之下、基础设施层之上的协议中间件
协议套件覆盖四个核心域:
| 域 | 协议版本 | 涵盖操作数 | 标准化内容 |
|---|---|---|---|
| LLM | LLM/v1 | 9个 | chat completion、streaming、function calling、token count |
| Embedding | Embedding/v1 | 6个 | embed text、batch embed、多模态 embed |
| Vector | Vector/v1 | 9个 | upsert、query、delete、metadata filter |
| Graph | Graph/v1 | 9个 | create node、create edge、traverse、subgraph |
33 个基础操作原语,覆盖了 AI 基础设施层的所有核心能力。
框架适配方面,SDK 在 corpus_sdk/ 目录下按域划分,每个域的 framework_adapters/ 子目录包含对以下六大框架的适配实现:
langchain-core 接口适配llama-index-core 接口适配autogen-agentchat / autogen-core 接口适配crewai 接口适配semantic-kernel 接口适配代码结构上,corpus_sdk/core/ 提供了同步/异步桥接层(sync_bridge.py / async_bridge.py)和上下文翻译层(context_translation.py),负责在协议标准格式和各框架原生格式之间做转换。corpus_sdk/router/ 中的 reference_router.py 则是商业版 Corpus Router 的参考实现,提供多模型、多框架的智能路由能力。
Corpus OS 最引以为豪的数字是:3,330 条 conformance tests,100% 通过率。测试覆盖分为五个层次:
tests/llm/、tests/vector/ 等)— 验证每个协议的每个操作原语是否符合规范定义。tests/frameworks/)— 同一套测试用例跨框架运行,保证「一次测试,多框架验证」。tests/schema/)— 验证请求/响应的 JSON Schema 是否符合规范。tests/golden/)— 用已知输入/输出对验证适配器的确定性行为。tests/live/)— 端到端的真实 API 调用测试。作为一个协议规范和 SDK 实现库,Corpus OS 没有图形界面,也不提供容器化部署。安装方式是标准 Python 包:
pip install corpus-sdk # 基础包(无框架依赖)
pip install corpus-sdk[frameworks] # 含所有六大框架适配器
pip install corpus-sdk[langchain] # 仅 LangChain 适配器
pip install corpus-sdk[llamaindex] # 仅 LlamaIndex 适配器
依赖要求:Python >= 3.10。框架适配器各自还有额外依赖,如 llama-index-core>=0.10.0、langchain-core>=0.1.0、crewai>=0.1.0 等。硬件需求极低,纯 Python SDK,不需要 GPU,普通开发机即可运行所有测试。
尽管 Corpus OS 解决了一个真实的痛点,但也面临挑战:
1. 框架版本同步成本。 LangChain、LlamaIndex 等框架更新频繁,适配层需要持续跟进,维护负担不轻。
2. 协议僵化风险。 协议升级需要考虑向后兼容,需要良好的社区治理来把控协议演进方向。
3. 商业化与开源的平衡。 协议层和 SDK 开源,但核心商业价值(Corpus Router)闭源。开放核心模式能否持续吸引社区贡献有待观察。
Corpus OS 把金融行业的协议化思维引入 AI 基础设施。FIX 协议让全球任何交易所的系统能互相通信,不是因为某家公司做了最强封装,而是因为大家约定了共同的消息格式。Corpus OS 正在为 AI 行业做类似的事——不是又一个框架封装,而是一套所有框架都能遵循的协议语言。
如果这个方向成功,未来的 AI 应用架构可能是:底层是任意 provider(OpenAI、Anthropic、Pinecone、Neo4j……),中间是 Corpus OS 协议层,上层是任意框架(LangChain、LlamaIndex……)。换底层不动上层,换框架不动底层。这才是真正意义上的「厂商中立」。
目前项目 Star 223(growth_trend_score: 13.74),虽然增长迅速,但协议的生命力在于生态,Corpus OS 的未来取决于能否吸引足够多的 provider 和 framework 官方参与适配,而不仅仅是社区贡献者。