evalscope
一站式大模型评测平台,支持 LLM/VLM/RAG/AIGC 多类型评测,pip 一键安装配 Web
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
一站式大模型评测平台,支持 LLM/VLM/RAG/AIGC 多类型评测,pip 一键安装配 Web
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
modelscope/evalscope 是阿里云 ModelScope 社区开源的一站式大模型评测框架,当前 GitHub ⭐ 2967。项目以 Python 为核心,聚焦 LLM、VLM、Embedding、RAG、AIGC 等多类型模型的评测与性能压测,支持一键启动和多后端集成。以下从部署和代码两个维度展开分析。
大模型时代,模型能力评测是研究和工程团队最核心的刚需之一。业界存在 OpenCompass、LM-Eval-Harness、BIG-bench 等多种评测工具,但各有局限:工具链分散、配置繁琐、可视化薄弱、难以横向对比。EvalScope 正是 ModelScope 社区为解决这一痛点而生的统一评测平台,其核心理念是**「一行命令搞定全流程」**——从数据加载、模型调度、评测执行到结果可视化,一气呵成。
该框架由 ModelScope 团队维护,背后依托阿里云模型服务,具备良好的生产级稳定性。Apache-2.0 许可证,商业友好。
EvalScope 提供 pip 一键安装:
pip install evalscope
依赖 Python >= 3.10,无 Docker 支持(无 Dockerfile / docker-compose),但提供 Web 界面(基于 Python Web 技术栈)。
| 模式 | 说明 | 硬件需求 |
|---|---|---|
| API 评测(推荐) | 调用 OpenAI 兼容 API,无需 GPU | 仅需网络 |
| 本地模型评测 | 从 ModelScope 自动下载并评测本地模型 | 需要 GPU(8GB+ VRAM) |
| Agent 评估模式 | 驱动 GSM8K、SWE-bench 等 Agent 任务 | 需要 Docker 环境 |
| 性能压测 | TTFT、TPOT 等推理性能指标测试 | 无 GPU 需求 |
evalscope eval \
--model your-model-name \
--api-url $OPENAI_API_BASE_URL \
--api-key $OPENAI_API_KEY \
--eval-type openai_api \
--datasets gsm8k arc \
--limit 5
图1:EvalScope Web Dashboard 总览 — 多模型横向对比一目了然
EvalScope 采用模块化分层架构,核心子模块如下:
| 模块 | 职责 |
|---|---|
evalscope/cli | 命令行入口,入口脚本为 evalscope |
evalscope/benchmarks | 内置评测基准(MMLU、C-Eval、GSM8K 等) |
evalscope/backend | 多后端调度(OpenCompass、VLMEvalKit、RAGEval) |
evalscope/models | 模型加载(本地/远程 API 统一封装) |
evalscope/evaluator | 评测结果评估逻辑 |
evalscope/metrics | 评分指标计算 |
evalscope/filters | 结果过滤 |
evalscope/report | 报告生成 |
evalscope/summarizer | 结果汇总 |
evalscope/service | 服务化部署 |
evalscope/web | Web 可视化界面 |
evalscope/agent | Agent 评测(Loop + Tool + Docker Sandbox) |
evalscope/perf | 推理性能压测 |
evalscope/api | API 服务化 |
EvalScope 最大的架构亮点是多后端兼容:
这种设计让用户无需切换工具,一套配置即可对比不同后端的评测结果。
EvalScope 支持受控多轮 Agent 评测(AgentLoop),具备以下特性:
图2:多模型得分对比 — 横向比较不同模型的各维度能力
EvalScope 提供功能丰富的 Web Dashboard:
图3:评测报告总览 — 结构化呈现各项指标得分
modelscope/evalscope 是当前开源社区最完整的大模型评测框架之一,由阿里 ModelScope 团队背书,覆盖从基准测试到性能压测的完整生命周期。对于 AI 研究者和工程师而言,它提供了开箱即用的评测基础设施;对于 AI 爱好者而言,它降低了理解模型能力边界的门槛。
一句话定位:一站式大模型评测平台,pip 一行命令即可对 LLM/VLM/RAG/AIGC 全类型模型进行能力与性能评测,并配套交互式 Web Dashboard。