llama-trl

用 PPO 强化学习 + LoRA 高效微调 LLaMA 的三阶段 RLHF 训练框架

Stars239
Forks24
主语言Python
分类模型与框架
作者jasonvanf
License

加载项目详情…