AgentGym-RL

AgentGym-RL

多轮强化学习训练长程决策Agent

AI官网

应用介绍

让大模型 Agent 完成需要几十步决策的任务,单轮训练方法很难教会它长远规划。AgentGym-RL 是复旦的工作,用多轮强化学习训练大模型 Agent 的长程决策能力。

它提供网页导航、搜索、游戏、科学实验等多种环境和统一训练框架,训练后的开源模型可比肩商业模型。

软件功能



多轮强化学习:长程决策。

多种环境:网页、搜索、游戏。

统一框架:模块化训练。