OpenJudge
开源 LLM 评测框架:50+ 评分器 + Auto-Rubric 自动生成 + RLHF 训练集成
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
开源 LLM 评测框架:50+ 评分器 + Auto-Rubric 自动生成 + RLHF 训练集成
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
你有没有过这样的困惑:上线了一个 AI 客服机器人,上线后效果到底好不好?靠人工打分手工评?成本高、效率低、还容易带主观偏见。OpenJudge 正在试图解决这个问题——它是一个开源的 LLM 评测框架,目标是让 AI 应用的评估变得像跑单元测试一样简单、可重复、自动化。
这个项目来自阿里巴巴和蚂蚁集团的 AI 团队,GitHub 获得 674 Stars,Apache-2.0 开源协议,在 Hugging Face 上有配套数据集,配套论文还登上了 arXiv。
图1:OpenJudge 项目 Logo
大语言模型(LLM)在各行各业的落地越来越广,但"模型好不好用"这件事,评价维度比传统软件复杂得多。传统软件的输出有明确对错,可以写断言跑 CI/CD;AI 应用的输出是自然语言,语义丰富、形式多样,难以用简单规则判定质量。
业内常见的做法是:
OpenJudge 的思路是引入 LLM-as-Judge(以大模型评价大模型):用一个训练好的评判模型(Grader),自动对另一个 AI 应用的输出进行多维度评分。这个评判模型可以基于规则定义,也可以通过数据驱动训练,甚至可以从标注样本中自动学习评估标准。
OpenJudge 内置了 50+ 评分器,覆盖三大评估维度:
| 类别 | 代表评分器 | 典型场景 |
|---|---|---|
| 通用 | Relevance、Similarity、Syntax Check、JSON Match | 语义相关性、文本相似度、结构合规 |
| 智能体(Agent) | Tool Selection、Memory、Plan、Trajectory | 工具调用准确性、上下文记忆、策略可行性 |
| 多模态 | Image Coherence、Text-to-Image、Image Helpfulness | 图文一致性、生成质量 |
每个评分器都配套基准数据集和 pytest 测试,确保评分结果可复现。
OpenJudge 提供了一条从"快速原型"到"生产级精度"的完整路径:
路径一:直接使用内置评分器 几行代码即可对 LLM 回复打分,不需要任何额外配置。
路径二:零样本评估标准生成 没有标注数据、需求也不完全清楚?只要描述清楚任务是什么,LLM 自动生成评估标准(Rubric),再基于这些标准打分。这个过程完全不需要训练数据,适合快速原型验证。
路径三:数据驱动的评估标准生成(Auto-Rubric) 有少量标注数据但人工设计评估规则太费时?OpenJudge 从你的标注样本中自动学习评估标准——聚类归纳为 N 个维度,再为每个维度生成评分细则。这篇论文 "Auto-Rubric: Learning to Extract Generalizable Criteria for Reward Modeling"(arXiv:2510.17314)详细介绍该方法。
路径四:训练专属 Judge 模型 数据量充足、追求极致精度?用 VERL 框架配合 OpenJudge 训练专用的 Reward Model,再用于 RLHF 微调。这个方向对应论文 "Taming the Judge: Deconflicting AI Feedback for Stable Reinforcement Learning"(arXiv:2510.15514)。
单个评分器只能评价一个维度,真实场景往往需要多维度综合打分。OpenJudge 提供 WeightedSumAggregator,支持配置多评分器的权重,输出一个加权综合分。例如电商客服场景:相关性 30%、幻觉率 40%、工具选择准确性 30%,权重分配由业务决定。
从代码结构来看,OpenJudge 的核心模块分为以下几个层次:
openjudge/models/ — 模型接入层。统一封装了 OpenAI、DashScope(阿里云通义)、MiniMax 等多家 LLM API,暴露统一的 chat 接口。
openjudge/graders/ — 评分器核心。按领域分类:common/(通用评分器)、agent/(智能体相关,含 action、memory、plan、reasoning、reflection、response 六大子维度)、skills/(Agent Skill 评估)、以及自定义评分器扩展接口。
openjudge/generator/ — 评估标准生成器。包含 SimpleRubricsGenerator(零样本快速生成)和 IterativeRubricsGenerator(数据驱动迭代生成)。
openjudge/runner/ — 评估执行引擎。支持并发批量运行评估任务,提供 GradingRunner 和多种聚合器。
openjudge/analyzer/ — 结果分析器。支持统计分析,输出分布、平均分等指标。
ui/ — 基于 Streamlit 的可视化界面(OpenJudge Studio)。提供评分器测试、Auto Arena(模型对战)、Auto Rubric 生成等功能的图形化操作界面,无需写代码也能使用。
OpenJudge 最吸引人的特性之一是在线体验平台 openjudge.me/app,无需安装任何依赖,在浏览器中即可:
这极大降低了使用门槛——给产品经理、运营人员也能快速上手评测 AI 应用的能力。
OpenJudge 提供两套 Dockerfile:
python:3.11-slim,安装 Streamlit Web UI,适合快速体验和轻量级评测Python 包本身通过 pip install py-openjudge 一键安装,依赖清晰(pandas、openai、pydantic、dashscope 等),Python 3.10+ 即可运行。
OpenJudge 团队还发布了配套的 PawBench 评测基准(2026-06-17 v1.0),同时评测"模型 × Harness(智能体运行时)"两个维度。关键发现:仅换一套 Harness 设计,同一模型的分数可以相差 10+ 分——这个发现说明智能体评测不能只看模型,评测框架本身(Harness)的选择同样关键。
尽管 OpenJudge 功能完善,有几个问题值得关注:
OpenJudge 是一个功能完整、层次清晰、接入门槛适中的 LLM 评测框架。它解决的问题非常实在:从"怎么评价我的 AI 应用做得好不好"这个痛点出发,提供了一套从快速原型到生产训练的完整工具链。50+ 内置评分器、Auto-Rubric 自动生成、VERL RLHF 训练集成,再加上免安装的在线体验平台,使其成为目前开源社区中最为完善的 LLM 评测解决方案之一。
对于 AI 开发者,它是可以直接接入 CI/CD 的自动化评估工具;对于 AI 爱好者,它是理解"AI 质量如何评价"的最佳实践入口。