ddpo

用强化学习直接优化扩散模型:DDPO 将去噪过程建模为多步决策,无需重新训练即可对齐人类审美和文字描

Stars579
Forks36
主语言Python
分类模型与框架
作者jannerm
License

加载项目详情…