Giskard

Giskard

开源的大模型Agent评测与测试库

AI官网

应用介绍

上线一个 AI Agent,它会不会胡编、会不会带偏见、RAG 检索准不准,靠人工抽查根本测不全。Giskard 是一个开源的大模型 Agent 评估与测试库,自动生成测试用例、做评测并发现问题。

v3 版本全新重写,模块化、轻量、异步优先,适合在上线前和 CI 中检验 Agent 质量。

软件功能



自动测试:生成测试用例。

质量评估:幻觉、偏见、准确性。

RAG 评测:检索效果分析。

异步优先:v3 轻量重写。