awesome-llm-human-preference-datasets
收录13个主流RLHF人类偏好数据集的精选索引,覆盖OpenAI、Anthropic、Stanfor
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
收录13个主流RLHF人类偏好数据集的精选索引,覆盖OpenAI、Anthropic、Stanfor
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
你有没有想过:为什么 GPT-4 比 GPT-3 更有用、更安全、更像人?答案藏在 GPT-3 到 GPT-4 之间那几十亿条人类偏好数据里。
这些数据不是凭空生成的,而是由成千上万的标注员一条一条打分、比较、投票产生的——这就是 RLHF(基于人类反馈的强化学习)的核心燃料。
收集这些数据的成本极高,OpenAI 训练 GPT-3.5 就花费了数百万美元。因此,大多数团队面临一个共同困境:没有高质量偏好数据,就训不出好模型。
awesome-llm-human-preference-datasets 正是为解决这一痛点而生——它将分散在各个论文、HuggingFace、GitHub 的 RLHF 数据集整合为一个持续更新的精选索引,让 AI 研究者和工程师不再需要翻遍全网去找数据。
这个 awesome-list 由 glgh(Unified-Language-Model-Alignment 组织)维护,仓库创建于 2023年5月,MIT 许可证,完全开源。截至目前已收录 13 个主流人类偏好数据集,覆盖 RLHF 全链路。
传统的 NLP 数据集(如 SuperGLUE、CoNLL)侧重于任务性能评估,而偏好数据集专注于「哪个回答更好」——这是一个更接近人类价值观的主观判断任务。两者缺一不可:基础 NLP 数据集教会模型「如何正确」,偏好数据集教会模型「哪种更好」。正是这种组合,支撑了 ChatGPT、Claude、Llama 等模型的对话能力。
列表按数据集来源分类,主要成员包括:
Anthropic HH-RLHF(170k):最经典的数据集之一,来自 Anthropic 2022年论文。包含 44k 帮助性比较和 42k 红队(无害性)比较,以及 52k 通过拒绝采样生成的高质量数据。另有 22k 来自 RLHF 在线训练迭代的数据。
Stanford SHP(385K):规模最大的公开偏好数据集,从 Reddit 18个领域自动采集 38.5 万条偏好对,完全免费可用,是 RLHF 训练和 NLG 评估的性价比之选。
OpenAI Summarization(64k):OpenAI 官方发布的摘要任务偏好数据,用于训练 GPT-3 的 RLHF 模型,相关论文被引用超过 4000 次,是 RLHF 领域的奠基性工作。
OpenAssistant OASST1(161k):由全球志愿者众包生成,35 种语言,46 万质量评分,1 万+完全标注的对话树,是目前最开源友好的对话偏好数据集之一。
HH_golden(42k):Anthropic HH-RLHF 的升级版,用 GPT-4 重写了「被拒绝」的回答,使无害性回答更加自然流畅而非生硬拒绝。实验证明在此数据集上训练可显著提升多种对齐方法的「无害性」指标。
使用门槛极低——你只需要一个 GitHub 账号或 HuggingFace 账号。直接在浏览器打开 README.md,就能按照分类找到需要的数据集链接,点击跳转到 HuggingFace 下载。每个数据集都附带了原始论文链接、数据规模和标注方式的简要说明。
局限性也需要正视:列表本身不托管数据,数据托管在 HuggingFace 或论文对应仓库,访问速度和稳定性依赖外部服务。另外部分数据集(如 OpenAI WebGPT)需要额外申请才能使用。
从行业视角看,人类偏好数据正在成为大模型竞争的核心壁垒。Anthropic、OpenAI、Google 都拥有大量未公开的内部偏好数据集,这正是 Claude 和 GPT-4 在对齐质量上领先开源模型的重要原因之一。
开源社区正在追赶:OASST1、SHP 等数据集的出现,让「人人皆可做 RLHF」成为可能。随着更多高质量开源偏好数据集的发布(如 UltraFeedback、HelpSteer),开源模型的对话质量正在快速缩小与闭源模型的差距。
这份 awesome-list 正是这场运动的催化剂——它降低了数据发现的门槛,让更多研究者能够快速找到合适的偏好数据,加速开源对齐研究的进展。