LLM-RLHF-Tuning-with-PPO-and-DPO

从零实现RLHF三阶段训练管线,支持PPO和DPO双算法,配套LoRA参数高效微调,适合深入学习大模型对齐技术

Stars193
Forks19
主语言Python
分类模型与框架
作者raghavc
License

加载项目详情…