IGPO

IGPO

基于信息增益的多轮搜索Agent训练

AI官网

应用介绍

训练多轮搜索 Agent,只在最后给一个对错奖励,中间哪一步搜得好坏无从得知,训练效率很低。IGPO 是 ICLR 2026 的工作,用每一轮带来的信息增益作为奖励信号,简单有效地优化多轮搜索 Agent。

仓库提供论文代码实现。

软件功能



信息增益奖励:每轮都有反馈。

多轮搜索:提升检索 Agent。

简单有效:易于实现。