Search-R1

Search-R1

训练模型边推理边搜索的强化学习框架

AI官网

应用介绍

大模型推理时知识不够就开始瞎编,简单地先检索再回答又不够灵活。Search-R1 是一个用强化学习训练大模型在推理过程中自主调用搜索引擎的框架。

它基于 veRL,高效可扩展,让模型学会何时搜、搜什么,并把结果融入推理。

软件功能



边推理边搜索:交替进行。

强化学习:自主学会检索。

高效训练:基于 veRL。