MCP-Universe
Salesforce开源的MCP Agent评测框架,支持6大任务领域200+MCP服务器的真实性评测基准
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
Salesforce开源的MCP Agent评测框架,支持6大任务领域200+MCP服务器的真实性评测基准
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
图1:MCP-Universe 系统概览,展示了真实世界 MCP 服务器评测的完整流程
当你试图让一个 AI Agent 完成「在 GitHub 上创建一个仓库、设置权限、编写 README 并推送到远程」这样的真实任务时,你会发现现有评测体系存在一个致命缺陷——大多数 benchmark 用的是简化过的「玩具任务」,与真实生产环境差距巨大。
MCP-Universe 正是为解决这个问题而生。它由 Salesforce AI Research 团队(领衔作者为 Ziyang Luo、Zhiqi Shen)打造,发布于 2025 年 arXiv(论文编号 arXiv:2508.14704),是首个专门针对 Model Context Protocol(MCP) 服务器进行真实世界评测的大模型基准框架。
MCP(Model Context Protocol)是 Anthropic 在 2024 年底提出的开放协议,旨在标准化 AI 模型与外部工具/数据源之间的交互方式。简单理解,MCP 就是 AI 领域的「USB-C 接口」——有了统一协议,各种 AI Agent 就能插上即用地调用任意工具。
Salesforce 作为企业软件巨头,拥有大量需要 AI Agent 与 Salesforce CRM、Slack、Notion、GitHub 等企业工具交互的场景。正是在这一背景下,MCP-Universe 应运而生。
该框架当前(2026年6月)已获得 591 GitHub Stars,收录于 Salesforce AI Research 官方仓库,Apache-2.0 许可证。
MCP-Universe 的核心是 MCPMark——一个覆盖 6 大任务领域的评测基准:
评测 Leaderboard 显示,Gemini-3-Pro-Preview 在综合成功率上以 44.59% 暂列第一,GPT-5-High 紧随其后(44.16%),Claude-4.5-Sonnet 达 35.06%,揭示了当前最强模型在真实工具调用场景下仍有巨大提升空间。
MCP-Universe 还推出了 MCP+ 创新模块——一个专为 MCP Agent 设计的上下文压缩包装器(wrapper)。它通过智能裁剪历史上下文,能够将 Token 消耗降低最高 75%,同时保持任务完成率基本不变。这对于需要长程推理的 Agent 场景意义重大。
集成宽搜(Width)与深搜(Depth)结合的深度研究 Agent,支持并行工具调用(parallel tool calling),能够同时探索多个信息维度再汇总结论,大幅提升研究效率。
提供了 MCP 服务器的统一接入层,支持 200+ 真实 MCP 服务器,覆盖计算器、GitHub、Slack、Notion、地图、金融数据、Blender 等各种类型。
MCP-Universe 采用高度模块化的 Python 包设计,核心包结构如下:
mcpuniverse/agent:Agent 核心实现,支持 ReAct 和 Function Call 两种调用模式mcpuniverse/benchmark:MCPMark 评测框架,支持自定义评测器和任务配置mcpuniverse/evaluator:评测器实现,多维度评分(成功率、步骤数、评估分)mcpuniverse/llm:多后端 LLM 接入(OpenAI、Anthropic、Mistral、Google、xAI 等)mcpuniverse/mcp:MCP 协议相关实现mcpuniverse/extensions:扩展模块,包含 MCP+ 和 Deep Research Agentmcpuniverse/pipeline:Pipeline 编排,支持复杂工作流mcpuniverse/rl:强化学习训练支持(集成 verl 框架)mcpuniverse/workflows:预置工作流模板mcpuniverse/dashboard:Gradio 可视化 Dashboardmcpuniverse/app:FastAPI Web 服务层架构设计遵循 Actor-Critic 模式:Agent(Actor)负责决策和工具调用,Evaluator(Critic)负责多维度评估,两者通过标准接口解耦,方便替换不同的 Agent 或评测器实现。
MCP-Universe 提供了完整的三层 Web 服务架构:
生产部署需要手动配置 PostgreSQL(数据库)、Redis(消息队列/缓存)和 Celery Worker。该层完全可选——纯本地评测只需安装 pip 包即可。
| 方式 | 难度 | 说明 |
|---|---|---|
| pip install | 低 | pip install mcpuniverse,适合本地快速体验 |
| Web 服务 | 中 | 需配置 PostgreSQL + Redis + Celery |
| Dashboard | 低 | pip install mcpuniverse[dashboard] 即可运行 Gradio UI |
| Docker | 不支持 | 当前无官方 Dockerfile,需自行封装 |
核心依赖:Python 3.10+,部分 MCP 服务器(如 Google Maps、Slack)需要 Node.js >= 18。
硬件需求:CPU 足以运行评测任务(使用外部 LLM API),如需本地推理需 GPU(通过 pip install mcpuniverse[vllm] 或 pip install mcpuniverse[sglang] 接入 vLLM/SGLang)。
评测覆盖的 MCP 服务器数量有限:目前只覆盖 6 大任务领域,部分企业常用 MCP(如 Salesforce 自身生态)暂未收录。
评测任务与真实生产环境仍有差距:评测任务虽基于真实 MCP 服务器,但任务描述和评分标准由框架预定义,与企业个性化需求存在一定偏差。
无容器化支持:缺少 Dockerfile 和 docker-compose,生产环境部署需要自行处理依赖和环境隔离,增加了运维成本。
Token 成本:运行完整评测需要频繁调用外部 LLM API,评测费用不可忽视。
MCP-Universe 的出现填补了 AI Agent 真实工具调用评测的空白。随着 MCP 协议逐渐成为行业标准(Anthropic、Google、GitHub、Slack 等纷纷支持),MCP-Universe 有望成为 MCP Agent 的「ImageNet 时刻」——为整个生态提供一个公认的质量标尺。
框架的 MCP+ 上下文压缩创新和 Deep Research Agent 设计,也代表了 2025-2026 年 Agent 架构演进的重要方向:更长的任务、更低的 Token 成本、更强的并行工具调用能力。