RL4VLM

用强化学习(PPO)微调大型视觉语言模型(VLM)做决策任务的标杆项目,NeurIPS 2024 论文官方实现

Stars417
Forks41
主语言Jupyter Notebook
分类模型与框架
作者RL4VLM
LicenseMIT

加载项目详情…