LLM-RLHF-Tuning

从零实现RLHF全流程,支持SFT+RM+PPO+DPO四阶段训练,以LoRA高效微调LLaMA/LLaMA2

Stars452
Forks24
主语言Python
分类模型与框架
作者Joyce94
License

加载项目详情…