应用介绍
改了一版提示词或换了模型,效果到底是变好还是变差,凭感觉判断不靠谱。OpenAI Evals 是一个评估大模型及其应用系统的框架,也是一个开源的评测基准库。
它支持自定义评测、模型打分和批量运行,可以把你的业务场景变成可重复的测试。
评测框架:自定义测试。
基准库:开源共享。
模型打分:自动评判。
可重复:回归对比。
它支持自定义评测、模型打分和批量运行,可以把你的业务场景变成可重复的测试。
软件功能
评测框架:自定义测试。
基准库:开源共享。
模型打分:自动评判。
可重复:回归对比。

