NLP-progress
NLP 领域的 SOTA 仪表盘,收录 30+ 任务的最前沿 benchmark 排行榜
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
NLP 领域的 SOTA 仪表盘,收录 30+ 任务的最前沿 benchmark 排行榜
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
当你准备开展一个新的 NLP 研究课题时,第一件事是什么?去 Google Scholar 翻论文?去 Hugging Face 找模型?还是在 GitHub 上大海捞针?这些方式各有各的问题——论文太散、模型太多、评测结果分散在不同网站的表格里,根本没法快速判断「当前这个任务的最强模型是什么」。 NLP-progress(项目主页:nlpprogress.com)就是为了解决这个问题而诞生的。它由 NLP 领域知名研究者 Sebastian Ruder 主导维护(他同时也是 DeepMind 的研究科学家),是一个将 NLP 各子任务的最前沿进展(SOTA — State of the Art)集中整理的 Markdown 文档库。简单来说,它就是整个 NLP 行业的一本「年度白皮书」——只不过每年更新数百次,而且精确到每个 benchmark 的具体分数。
NLP-progress 的核心价值,在于它系统性地覆盖了 NLP 领域的核心任务体系。项目仓库以 Markdown 文件的形式,按语言和任务两条维度进行组织。英文任务最全,涵盖了超过 30 个子任务方向,包括:
每个任务页面都维护了一张「排行榜」式的 Markdown 表格,格式统一包含:模型名称、评测指标(如 BLEU、Perplexity、Accuracy)、参数量、论文出处、以及代码链接(区分官方实现和社区实现)。以机器翻译 WMT 2014 EN-DE 数据集为例:
| 模型 | BLEU | 论文 |
|---|---|---|
| Transformer Big + BT | 35.0 | Understanding Back-Translation at Scale |
| DeepL | 33.3 | DeepL 新闻稿 |
| Transformer Big | 29.3 | Scaling Neural Machine Translation |
| 这些表格不仅记录数字,更记录了 NLP 技术演进的轨迹。从早期的 RNN/Seq2Seq,到 Transformer 统一江湖,再到近年的大模型时代——你可以在同一张表格里看到技术浪潮的更迭。 | ||
| 语言建模任务(Penn Treebank)的记录则更直观地体现了模型进化史: | ||
| 时代 | 代表模型 | 最佳 Perplexity |
| :--- | :--- | :---: |
| RNN 时代 | AWD-LSTM | 55.97 |
| 早期 Transformer | Transformer-XL | 54.52 |
| 近年动态评估 | Mogrifier RLSTM | 42.9 |
| NLP-progress 的贡献者指南也相当友好。任何人发现新的 SOTA 结果,只需点击文件右上角的 Edit 按钮即可直接在 GitHub 网页端修改 Markdown 表格,提交 PR 即可参与协作。 | ||
![]() | ||
| 图1:通过 GitHub 网页端直接编辑 SOTA 表格 | ||
| 贡献门槛极低,无需懂代码,只要能看懂论文结果、会写 Markdown 就能上手——这也是项目能持续活跃的重要原因。 |
项目的灵魂人物 Sebastian Ruder 可能是 NLP 圈子里最活跃的技术博主之一。他长期在 DeepMind 从事多语言模型和迁移学习研究,同时运营着著名的 Ruder Blog,持续输出高质量的 NLP 科普文章。 NLP-progress 的诞生背景其实很朴素:Ruder 本人在做研究时,发现每进入一个新的子领域都要花大量时间搜集和对比 SOTA 结果——而这些信息明明应该是公开的、集中的。于是他干脆自己动手建了这个库,最初只是个人笔记,后来随着社区贡献逐渐壮大,如今已成为 NLP 学者入门必读的参考资料。 值得注意的是,这个项目的「技术栈」几乎为零:它本质上就是一个 Jekyll 静态网站,托管在 GitHub Pages 上,没有任何后端服务。但这恰恰体现了它的设计哲学——用最少的工程成本,换取最大的知识传播效率。
当然,这个项目也有其局限性。首先,它无法追踪大模型时代的新评测范式——随着 GPT-4、Claude、LLaMA 等大模型的出现,很多传统 benchmark(如 SuperGLUE)已经接近饱和,新一代的评测标准(如 BIG-bench、MMLU)才是更前沿的战场,NLP-progress 在这方面的覆盖相对滞后。 其次,表格的更新依赖社区贡献,存在一定延迟,最新的 SOTA 结果可能需要数周甚至数月才能录入。 此外,部分任务页面内容较为简略,缺乏对数据集背景、评测设置的详细解释——读者需要自行查阅原始论文来理解评测细节。
从 2017 年创建至今,NLP-progress 已积累超过 2.2 万颗星,成为 NLP 领域被引用最多的元数据资源之一。它的成功折射出一个更广泛的现象:在 AI 领域,「整理」本身就是一种核心贡献。当信息过载成为常态,能够帮助人们高效梳理和定位知识的人,其价值不亚于提出新模型的学者。
图2:通过 GitHub PR 流程提交新的 SOTA 结果
对于 AI 爱好者和开发者而言,NLP-progress 不是一个需要「部署」的项目,而是一个需要「收藏」的在线知识库。直接访问 nlpprogress.com,或者 clone 仓库本地阅读,都是极低成本的接入方式。如果你正在从事 NLP 相关工作,这个项目值得放进你的浏览器书签栏。