
Description
Comparing LLMs on reasoning, coding and long context is hard when vendors report differently and testing needs many datasets. OpenCompass is a one-stop LLM evaluation platform.
It supports OpenAI, Anthropic, Gemini, Qwen, GLM, DeepSeek and more across 100+ datasets with one-command batch evaluation.
Models:Major vendors.
100+ datasets:Broad coverage.
One command:Batch runs.
Leaderboards:Comparisons.
It supports OpenAI, Anthropic, Gemini, Qwen, GLM, DeepSeek and more across 100+ datasets with one-command batch evaluation.
Features
Models:Major vendors.
100+ datasets:Broad coverage.
One command:Batch runs.
Leaderboards:Comparisons.

