evals-skills
面向AI编程助手的标准化评测技能包,涵盖审计、错误分析、LLM评判器设计等7大流程
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
面向AI编程助手的标准化评测技能包,涵盖审计、错误分析、LLM评判器设计等7大流程
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
当你接手一个 AI 项目,发现它的"评测"模块一团乱麻——评测指标定得模糊、数据集没代表性、LLM 评判器(LLM-as-Judge)从未校准过,你是否感到无从下手?Hamelsmu/evals-skills 就是来解决这个问题的。它是一套面向 AI 编程助手(Claude Code 等)的评测技能包,把 50+ 公司踩坑总结成可直接调用的标准化流程。
开发 AI 产品的人常有这样的经历:模型上线前测得"效果不错",一上线才发现各种问题。这背后往往是评测环节出了问题——没有系统分析过真实失败场景,评判标准拍脑袋定,评测数据靠人工标注凑合……
Hamel Husain(前 GitHub 机器学习工程师,曾参与 GitHub Copilot 早期研发)和 Shreya Shankar(UC Berkeley 博士,AI 评测领域研究者)联合推出了 AI Evals for Engineers 课程,evals-skills 就是配套的开源技能包。他们的核心理念是:评测不是玄学,是可以通过系统方法论来规范化的工程问题。
这套技能包的作者在帮助 50+ 公司落地 AI 评测的过程中,发现了大量共性错误,并将其提炼为可复用的操作流程。MIT 许可证,完全开源。
evals-skills 包含 7 个核心技能,覆盖从"发现问题"到"构建工具"的全链路:
当你第一次接触一个 AI 评测系统,或感觉现有评测不可信时,用这个技能。它会引导你对评测 pipeline 做 6 个维度的诊断检查:错误分析是否系统化、失败类别是否有数据支撑、评判器是否经过校准、评测数据是否真实代表生产数据、指标是否 Vanity Metrics(好看但无用)、Human-in-the-Loop 是否到位。
审计结果按影响程度排序,每项发现都会给出具体的修复路径——直接链接到其他技能。例如"缺少错误分析"会建议先执行 error-analysis 技能。
这是整个评测流程的起点。技能指导你收集约 100 条代表性 trace(输入→LLM调用→工具使用→最终输出),逐条判断 Pass/Fail,记录失败原因,然后将相似失败归类,形成"失败模式目录"。关键原则是:让失败类别从真实数据中涌现,而不是先入为主地定义。
失败类别一旦确定,就能为后续构建针对性的 LLM 评判器提供基础。这一步做扎实了,后续所有评测才有意义。
对于难以用代码检查的软性指标(如"语气是否合适"、"回答是否完整"),需要用 LLM-as-Judge 来评估。这个技能教你设计一个严格二值 Pass/Fail 的评判提示词——每个评判器只检查一个失败模式。
提示词包含四个必需组件:任务定义 + Pass/Fail 标准(带正反例)+ Few-shot 示例 + 输出格式约束。技能特别强调避免常见错误:用具体领域语言定义标准,不用"质量"、"相关性"这类模糊词。
写好评判器后,必须验证它是否真的可靠。这个技能使用 TPR(真阳性率)/TNR(真阴性率) 来衡量评判器与人类标注的对齐程度。要求 Dev 集上 TPR 和 TNR 均超过 90% 才算合格。
数据划分策略是 Train(10-20%)/ Dev(40-45%)/ Test(40-45%),Train 用作 Few-shot 示例,Dev 用于反复迭代调优,Test 仅在最终验证时使用一次,避免过拟合。
当生产数据稀疏时,需要合成测试输入。技能使用维度元组生成法:先定义影响评测质量的轴(如任务类型、用户画像、场景复杂度),然后通过组合生成多样化测试案例,最后用 LLM 扩展到更大规模。
关键原则:合成数据的维度必须针对预期的失败场景,不是随意变化。
RAG 系统有两个核心组件需要独立评测:检索质量(Recall@k)和生成质量(忠实性、相关性)。技能强调必须先通过错误分析判断瓶颈在检索还是生成,然后针对性地优化。检索优先于生成——检索没做好,生成再强也是无米之炊。
人工标注是评测数据质量的保障。这个技能指导你构建一个浏览器端的 trace 审阅工具:加载 JSON/CSV 格式的 trace 数据,以人类友好方式展示(邮件渲染为邮件、代码高亮语法),提供 Pass/Fail + 备注按钮,自动保存标注结果到本地文件。
界面设计原则:只展示对判断有帮助的信息,把无关细节折叠隐藏;用颜色区分消息角色;让主判断内容视觉上最突出。
项目本身是纯 Markdown 文件仓库,不涉及任何代码执行。架构上分为两层:
.claude-plugin/:Claude Code 插件配置文件(plugin.json + marketplace.json),定义了插件元数据和可用技能列表skills/:每个子目录对应一个独立技能,包含 SKILL.md 文件每个 SKILL.md 的结构遵循统一规范:YAML frontmatter(name + description)+ Markdown 正文(Overview、Prerequisites、Core Process、具体步骤),部分技能还包含模板代码块(如 Python 数据划分示例、Prompt 模板)。
代码量极小(总代码量约 0 行),重点在于 流程设计的质量 而非代码实现。所有技能都基于 YAML frontmatter 暴露元数据,可被 Claude Code 插件系统自动发现和加载。
方式一:通过 Claude Code 安装(推荐):
# 注册插件仓库
/plugin marketplace add hamelsmu/evals-skills
# 安装插件
/plugin install evals-skills@hamelsmu-evals-skills
重启 Claude Code 后,技能以 /evals-skills:<skill-name> 格式调用,如 /evals-skills:eval-audit。
方式二:通过 npx skills CLI:
npx skills add https://github.com/hamelsmu/evals-skills
升级: Claude Code 用户运行 /plugin update evals-skills@hamelsmu-evals-skills;npx skills 用户运行 npx skills update。
作者坦诚列出了这套技能的边界:它处理的是评测工作中可以泛化的部分。每个项目特有的领域知识、标注团队的组建、特定行业的合规要求等,都需要自己解决。
此外,这套技能面向的是有工程能力的用户(理解 JSON、会写 Python、能看懂 trace 数据)。对于完全不了解评测的纯业务人员,上手有一定门槛。
随着 LLM 应用大规模落地,"如何科学地评测 AI 系统" 成为行业刚需。evals-skills 的价值在于把分散在论文、博客、会议演讲中的评测最佳实践,整理成可直接使用的操作指南。
项目 Star 持续增长(目前 1378+),作者 Hamel Husain 在 AI 评测领域有较高影响力(博客 hamel.dev 是该领域的必读资源)。AI Evals for Engineers 课程 提供更完整的视频教学,evals-skills 作为配套实践工具,形成了"课程 + 代码技能"的学习闭环。

图1:项目作者 Hamel Husain —— 前 GitHub 机器学习工程师,AI 评测领域实践者
如果你正在构建或接手 AI 产品的评测体系,这套技能包值得作为起步参考。先用 eval-audit 做一次诊断,再按需深入具体技能,比从头摸索要高效得多。