OpenCompass

OpenCompass

LLM evaluation platform

Description

Comparing LLMs on reasoning, coding and long context is hard when vendors report differently and testing needs many datasets. OpenCompass is a one-stop LLM evaluation platform.

It supports OpenAI, Anthropic, Gemini, Qwen, GLM, DeepSeek and more across 100+ datasets with one-command batch evaluation.

Features



Models:Major vendors.

100+ datasets:Broad coverage.

One command:Batch runs.

Leaderboards:Comparisons.