RAGEN

用StarPO强化学习框架训练LLM reasoning agents,解决多轮交互环境中的长程决策

Stars2.8k
Forks227
主语言Python
分类模型与框架
作者mll-lab-nu
License

加载项目详情…