Skip to main content
leaderboard
.cn
Toggle Sidebar
Search models or organizations…
⌘K
Explore
Frontier Models
Historical Trends
Local Models
Compare Models
Ranking Studio
Library
Models
Pricing
Organizations
Benchmarks
Data sources
Settings
Toggle Sidebar
leaderboard
.cn
Loading page content
Feedback
Loading page content
Benchmarks
Browse evaluation benchmarks and the results collected across models.
Benchmark list
Filters
Arena Text Rating
Reasoning
Details →
Models evaluated
354
Effective sources
1
Scoring unit
Elo
Direction
Higher is better
GPQA-Diamond
Reasoning
Details →
Models evaluated
126
Effective sources
37
Scoring unit
%
Direction
Higher is better
Arena Vision Rating
Multimodal
Details →
Models evaluated
121
Effective sources
1
Scoring unit
Elo
Direction
Higher is better
MMLU-Redux
Reasoning
Details →
Models evaluated
102
Effective sources
15
Scoring unit
%
Direction
Higher is better
MMLU-Pro
Reasoning
Details →
Models evaluated
95
Effective sources
21
Scoring unit
%
Direction
Higher is better
Arena WebDev Rating
Coding
Details →
Models evaluated
88
Effective sources
1
Scoring unit
Elo
Direction
Higher is better
Arena Text to Image Rating
Multimodal
Details →
Models evaluated
76
Effective sources
0
Scoring unit
Elo
Direction
Higher is better
INCLUDE
Multilingual
Details →
Models evaluated
69
Effective sources
4
Scoring unit
%
Direction
Higher is better
SuperGPQA
Reasoning
Details →
Models evaluated
65
Effective sources
13
Scoring unit
%
Direction
Higher is better
C-Eval
Chinese
Details →
Models evaluated
64
Effective sources
11
Scoring unit
%
Direction
Higher is better
SWE-bench Verified
Coding
Details →
Models evaluated
60
Effective sources
21
Scoring unit
%
Direction
Higher is better
AIME 2025
Reasoning
Details →
Models evaluated
60
Effective sources
8
Scoring unit
%
Direction
Higher is better
HLE (Humanity's Last Exam)
Reasoning
Details →
Models evaluated
57
Effective sources
21
Scoring unit
%
Direction
Higher is better
IFEval strict prompt
Instruction following
Details →
Models evaluated
55
Effective sources
7
Scoring unit
%
Direction
Higher is better
Arena Image Edit Rating
Multimodal
Details →
Models evaluated
54
Effective sources
0
Scoring unit
Elo
Direction
Higher is better
AIME 2024
Reasoning
Details →
Models evaluated
51
Effective sources
7
Scoring unit
%
Direction
Higher is better
LiveCodeBench-v6
Reasoning
Details →
Models evaluated
49
Effective sources
16
Scoring unit
%
Direction
Higher is better
BFCL v3 Full
Agents
Details →
Models evaluated
49
Effective sources
5
Scoring unit
%
Direction
Higher is better
WritingBench
Writing
Details →
Models evaluated
47
Effective sources
4
Scoring unit
%
Direction
Higher is better
SWE-bench Pro
Coding
Details →
Models evaluated
46
Effective sources
22
Scoring unit
%
Direction
Higher is better
MMLU
Reasoning
Details →
Models evaluated
46
Effective sources
5
Scoring unit
%
Direction
Higher is better
MultiIF
Multilingual
Details →
Models evaluated
45
Effective sources
4
Scoring unit
%
Direction
Higher is better
BrowseComp
Agents
Details →
Models evaluated
44
Effective sources
17
Scoring unit
%
Direction
Higher is better
MATH 500
Reasoning
Details →
Models evaluated
44
Effective sources
4
Scoring unit
%
Direction
Higher is better
PolyMath
Multilingual
Details →
Models evaluated
44
Effective sources
4
Scoring unit
%
Direction
Higher is better
Creative Writing v3
Writing
Details →
Models evaluated
42
Effective sources
3
Scoring unit
%
Direction
Higher is better
LiveBench 20241125
Reasoning
Details →
Models evaluated
42
Effective sources
3
Scoring unit
%
Direction
Higher is better
Arena Search Rating
Agents
Details →
Models evaluated
42
Effective sources
1
Scoring unit
Elo
Direction
Higher is better
Arena Image to Video Rating
Multimodal
Details →
Models evaluated
42
Effective sources
0
Scoring unit
Elo
Direction
Higher is better
Arena Text to Video Rating
Multimodal
Details →
Models evaluated
42
Effective sources
0
Scoring unit
Elo
Direction
Higher is better
MCP-Atlas
Agents
Details →
Models evaluated
40
Effective sources
17
Scoring unit
%
Direction
Higher is better
MMMLU
Reasoning
Details →
Models evaluated
40
Effective sources
4
Scoring unit
%
Direction
Higher is better
Arena-Hard
Conversation
Details →
Models evaluated
39
Effective sources
3
Scoring unit
%
Direction
Higher is better
ZebraLogic
Reasoning
Details →
Models evaluated
39
Effective sources
3
Scoring unit
%
Direction
Higher is better
SWE-bench Multilingual
Coding
Details →
Models evaluated
38
Effective sources
14
Scoring unit
%
Direction
Higher is better
HLE (w/ Tools)
Reasoning · Agents
Details →
Models evaluated
37
Effective sources
15
Scoring unit
%
Direction
Higher is better
LiveCodeBench v5
Coding
Details →
Models evaluated
36
Effective sources
1
Scoring unit
%
Direction
Higher is better
IMOAnswerBench
Reasoning
Details →
Models evaluated
35
Effective sources
15
Scoring unit
%
Direction
Higher is better
AlignBench v1.1
Conversation
Details →
Models evaluated
35
Effective sources
1
Scoring unit
score
Direction
Higher is better
AutoLogi
Reasoning
Details →
Models evaluated
35
Effective sources
1
Scoring unit
%
Direction
Higher is better
MLogiQA
Multilingual
Details →
Models evaluated
35
Effective sources
1
Scoring unit
%
Direction
Higher is better
MMMLU 14 languages
Multilingual
Details →
Models evaluated
35
Effective sources
1
Scoring unit
%
Direction
Higher is better
MT-AIME 2024
Multilingual
Details →
Models evaluated
35
Effective sources
1
Scoring unit
%
Direction
Higher is better
MMMU-Pro
Multimodal
Details →
Models evaluated
34
Effective sources
8
Scoring unit
%
Direction
Higher is better
HMMT Nov. 2025
Reasoning
Details →
Models evaluated
32
Effective sources
9
Scoring unit
%
Direction
Higher is better
MultiPL-E
Coding
Details →
Models evaluated
31
Effective sources
3
Scoring unit
%
Direction
Higher is better
Arena Agent Bash Recovery
Agents
Details →
Models evaluated
31
Effective sources
1
Scoring unit
%
Direction
Higher is better
Arena Agent Confirmed Success
Agents
Details →
Models evaluated
31
Effective sources
1
Scoring unit
%
Direction
Higher is better
Arena Agent Net Improvement
Agents
Details →
Models evaluated
31
Effective sources
1
Scoring unit
%
Direction
Higher is better
Arena Agent Praise vs Complaint
Agents
Details →
Models evaluated
31
Effective sources
1
Scoring unit
%
Direction
Higher is better
Arena Agent Steerability
Agents
Details →
Models evaluated
31
Effective sources
1
Scoring unit
%
Direction
Higher is better
Arena Agent Tool Hallucination
Agents
Details →
Models evaluated
31
Effective sources
1
Scoring unit
%
Direction
Higher is better
IFEval
Instruction following
Details →
Models evaluated
30
Effective sources
7
Scoring unit
%
Direction
Higher is better
BBH
Reasoning
Details →
Models evaluated
30
Effective sources
2
Scoring unit
%
Direction
Higher is better
GSM8K
Reasoning
Details →
Models evaluated
30
Effective sources
2
Scoring unit
%
Direction
Higher is better
MATH
Reasoning
Details →
Models evaluated
30
Effective sources
2
Scoring unit
%
Direction
Higher is better
Terminal Bench 2.0 (Terminus-2)
Coding
Details →
Models evaluated
29
Effective sources
13
Scoring unit
%
Direction
Higher is better
CharXiv(RQ)
Multimodal
Details →
Models evaluated
29
Effective sources
9
Scoring unit
%
Direction
Higher is better
Aider Polyglot
Coding
Details →
Models evaluated
29
Effective sources
7
Scoring unit
%
Direction
Higher is better
GPQA
Reasoning
Details →
Models evaluated
29
Effective sources
2
Scoring unit
%
Direction
Higher is better
Page 1 of 10
1
2
3
4
5
…
More pages
10