trlx

基于强化学习的人类反馈(RLHF)训练框架,支持 PPO/ILQL 算法微调 70B+ 大语言模型

Stars4.8k
Forks487
主语言Python
分类模型与框架
作者CarperAI
License

加载项目详情…