safe-rlhf

首个将安全约束以数学形式引入 RLHF 训练的开源框架,通过 Cost Model + Lagrange 优化实现大模型 Helpful 与 Harmless 的双目标对齐

Stars1.6k
Forks133
主语言Python
分类模型与框架
作者PKU-Alignment
License

加载项目详情…