
Description
Teaching LLM agents tasks that take dozens of decisions is hard with single-turn training. AgentGym-RL from Fudan trains LLM agents for long-horizon decision making with multi-turn reinforcement learning.
It offers web navigation, search, games and science environments in a unified framework, with trained open models rivaling commercial ones.
Multi-turn RL:Long-horizon decisions.
Environments:Web, search and games.
Framework:Modular training.
It offers web navigation, search, games and science environments in a unified framework, with trained open models rivaling commercial ones.
Features
Multi-turn RL:Long-horizon decisions.
Environments:Web, search and games.
Framework:Modular training.

