SkillCorpus
EverMind-AI/SkillCorpus加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
你让 AI Agent 帮你从 PDF 里提取表格,它吭哧吭哧半天,结果格式全乱。换成另一个 Agent 问同样的问题,它却能精准提取——差别在哪?不在模型本身,在于后者有对应任务的手册(SKILL.md)注入上下文。
SkillCorpus 解决的就是这个问题:把 GitHub 上散落的 SKILL.md 文件收集起来,建立一套检索管道,让 Agent 在执行任务前能自动找到最相关的手册,而不是靠模型自己"凭感觉"。
这个项目来自 EverMind AI 团队,背后有一篇正式论文(arXiv:2607.15557)支撑,并在多个主流 Agent 平台上提供了开箱即用的插件。
当前的 AI Agent 普遍存在一个困境:通用模型在开放域对话上表现出色,但在需要精确操作步骤的任务上频繁出错——比如"用 PyMuPDF 从扫描件里提取表格"、"用 FFmpeg 把视频转成 GIF"这类需要精确参数和边界条件的工作。
模型的预训练知识不够精确,或者干脆没有这方面的流程知识。传统解法是手动维护一套 SOP(标准操作流程),但这面临几个现实问题:
SkillCorpus 的思路是:建立一套开放技能库(Skill Corpus),通过向量检索匹配任务,自动把相关手册注入 Agent 上下文。这本质上是一个 RAG(检索增强生成)系统,但检索目标是结构化的技能文档,而非通用文本。
SkillCorpus 不只是爬虫,它有一条完整的处理流水线:
aggregate → curate → export
治理管道里一个关键设计:许可证分层(GREEN/YELLOW/RED)。只有来源明确为 MIT、Apache-2.0、BSD 等宽松许可证的仓库才会被纳入采集范围,每个技能保留原始许可证,不存在二次授权问题。
检索质量直接决定了技能注入的效果。SkillCorpus 发布了两款专用模型:
这套组合在论文中有量化评估:在 SkillsBench(最依赖精确流程的任务)上,使用检索注入后 Qwen3.5-397B 的通过率从 11.1% 提升至 16.9%,提升幅度达 52%。
项目自带三个评测基准,用于评估检索效果:
| 基准 | 侧重 | 说明 |
|---|---|---|
| SkillsBench | 精确流程 | 最依赖技能注入,通过率提升最显著 |
| GDPVal | 经济任务 | 模型本身能力较强,提升较小 |
| QwenClawBench | 综合能力 | 中等提升幅度 |
SkillCorpus 的独到之处在于它不仅是一个数据集,更是一套可插拔的集成层。目前已支持:
插件的核心逻辑很轻量:安装后自动配置 ~/.evermind-skillsearch/ 共享技能目录,从 SkillHub API 检索技能并注入上下文中,无需手动维护 SOP。
SkillCorpus 的 SkillHub 提供公开 API,无需克隆仓库,直接调用即可:
curl "https://skillhub.evermind.ai/openapi/v1/skills?q=extract+tables+from+a+PDF"
Python 脚本(纯 stdlib,无依赖)示例:
python examples/skillhub_demo.py "extract tables from a scanned PDF invoice"
# 输出:检索到 2 个相关技能,注入后构建了 36,742 字符的 prompt
如果不想依赖 SkillHub API,可以自部署检索模型:
pip install -r skillcorpus/match/requirements.txt
EMBEDDING_MODEL=<checkpoint> RERANKER_MODEL=<checkpoint> \
bash skillcorpus/match/scripts/run_server.sh
# 启动 /embed + /score 两个端点
用自己的私有仓库或自定义来源建立专属技能库:
git clone https://github.com/EverMind-AI/SkillCorpus.git
pip install -e .
python -m skillcorpus.cli build # 运行完整的采集→治理→导出流程
python -m skillcorpus.cli stats # 查看统计
| 维度 | 说明 |
|---|---|
| 编程语言 | Python >= 3.10 |
| 核心依赖 | pyyaml, numpy, click, faiss-cpu, sqlite-vec, openai, pyarrow, zstandard |
| 评测依赖 | torch>=2.8, transformers>=5.2, datasets>=2.14 |
| 许可证 | Apache-2.0(核心代码);MIT(match/ 和 evaluate/ 工具包) |
| 模型底座 | Qwen3-Embedding-0.6B / Qwen3-Reranker-0.6B |
| 数据格式 | Parquet + Zstandard 压缩附件包 |
| 插件机制 | Hermes、OpenClaw、DeepSeek Harness、WorkBuddy、Raven |
| 最新版本 | v0.4.0(2026-09-17) |
SkillCorpus 提出了一个很务实的观点:AI Agent 的执行质量瓶颈,不在于模型推理能力,而在于缺乏精确的领域知识注入。通过建立开放、可审计、带许可证的技能库,配合专用检索模型,它让 Agent 的"查手册执行"变得可工程化。
从生态角度看,SkillCorpus 的多 Agent 平台插件生态值得关注:它不只是为某一个 Agent 平台服务,而是以 SKILL.md 格式作为跨平台技能标准,通过插件层适配不同 Agent 的上下文注入机制。这种思路降低了技能维护的重复劳动,也为未来开放技能市场的建立提供了基础设施。
在线体验:https://evermind.ai/skillhub
论文:arXiv:2607.15557
HuggingFace 数据集:EverMind-AI/skillcorpus-demo-1k