OpenAI Evals

OpenAI Evals

评估大模型与模型系统的框架

AI官网

应用介绍

改了一版提示词或换了模型,效果到底是变好还是变差,凭感觉判断不靠谱。OpenAI Evals 是一个评估大模型及其应用系统的框架,也是一个开源的评测基准库。

它支持自定义评测、模型打分和批量运行,可以把你的业务场景变成可重复的测试。

软件功能



评测框架:自定义测试。

基准库:开源共享。

模型打分:自动评判。

可重复:回归对比。

应用截图