Skip to main content
leaderboard
.cn
Toggle Sidebar
Search models or organizations…
⌘K
Explore
Frontier Models
Historical Trends
Local Models
Compare Models
Ranking Studio
Library
Models
Pricing
Organizations
Benchmarks
Data sources
Settings
Toggle Sidebar
leaderboard
.cn
Loading page content
Feedback
Loading page content
Benchmarks
Browse evaluation benchmarks and the results collected across models.
Benchmark list
Filters
Arena Text Rating
Reasoning
Details →
Models evaluated
375
Effective sources
1
Scoring unit
Elo
Direction
Higher is better
GPQA-Diamond
Reasoning
Details →
Models evaluated
138
Effective sources
44
Scoring unit
%
Direction
Higher is better
Arena Vision Rating
Multimodal
Details →
Models evaluated
133
Effective sources
1
Scoring unit
Elo
Direction
Higher is better
Arena WebDev Rating
Coding
Details →
Models evaluated
106
Effective sources
2
Scoring unit
Elo
Direction
Higher is better
MMLU-Redux
Reasoning
Details →
Models evaluated
102
Effective sources
15
Scoring unit
%
Direction
Higher is better
MMLU-Pro
Reasoning
Details →
Models evaluated
96
Effective sources
21
Scoring unit
%
Direction
Higher is better
Arena Text to Image Rating
Multimodal
Details →
Models evaluated
79
Effective sources
0
Scoring unit
Elo
Direction
Higher is better
HLE (Humanity's Last Exam)
Reasoning
Details →
Models evaluated
69
Effective sources
27
Scoring unit
%
Direction
Higher is better
INCLUDE
Multilingual
Details →
Models evaluated
69
Effective sources
4
Scoring unit
%
Direction
Higher is better
SuperGPQA
Reasoning
Details →
Models evaluated
65
Effective sources
13
Scoring unit
%
Direction
Higher is better
C-Eval
Chinese
Details →
Models evaluated
64
Effective sources
11
Scoring unit
%
Direction
Higher is better
SWE-bench Verified
Coding
Details →
Models evaluated
63
Effective sources
22
Scoring unit
%
Direction
Higher is better
AIME 2025
Reasoning
Details →
Models evaluated
60
Effective sources
8
Scoring unit
%
Direction
Higher is better
Arena Image Edit Rating
Multimodal
Details →
Models evaluated
56
Effective sources
0
Scoring unit
Elo
Direction
Higher is better
SWE-bench Pro
Coding
Details →
Models evaluated
55
Effective sources
28
Scoring unit
%
Direction
Higher is better
IFEval strict prompt
Instruction following
Details →
Models evaluated
55
Effective sources
7
Scoring unit
%
Direction
Higher is better
LiveCodeBench-v6
Reasoning
Details →
Models evaluated
52
Effective sources
18
Scoring unit
%
Direction
Higher is better
Arena Agent Bash Recovery
Agents
Details →
Models evaluated
52
Effective sources
1
Scoring unit
%
Direction
Higher is better
Arena Agent Confirmed Success
Agents
Details →
Models evaluated
52
Effective sources
1
Scoring unit
%
Direction
Higher is better
Arena Agent Net Improvement
Agents
Details →
Models evaluated
52
Effective sources
1
Scoring unit
%
Direction
Higher is better
Arena Agent Praise vs Complaint
Agents
Details →
Models evaluated
52
Effective sources
1
Scoring unit
%
Direction
Higher is better
Arena Agent Steerability
Agents
Details →
Models evaluated
52
Effective sources
1
Scoring unit
%
Direction
Higher is better
Arena Agent Tool Hallucination
Agents
Details →
Models evaluated
52
Effective sources
1
Scoring unit
%
Direction
Higher is better
AIME 2024
Reasoning
Details →
Models evaluated
51
Effective sources
7
Scoring unit
%
Direction
Higher is better
BFCL v3 Full
Agents
Details →
Models evaluated
49
Effective sources
5
Scoring unit
%
Direction
Higher is better
BrowseComp
Agents
Details →
Models evaluated
47
Effective sources
20
Scoring unit
%
Direction
Higher is better
HLE (w/ Tools)
Reasoning · Agents
Details →
Models evaluated
47
Effective sources
20
Scoring unit
%
Direction
Higher is better
WritingBench
Writing
Details →
Models evaluated
47
Effective sources
4
Scoring unit
%
Direction
Higher is better
MCP-Atlas
Agents
Details →
Models evaluated
46
Effective sources
20
Scoring unit
%
Direction
Higher is better
MMLU
Reasoning
Details →
Models evaluated
46
Effective sources
5
Scoring unit
%
Direction
Higher is better
Arena Image to Video Rating
Multimodal
Details →
Models evaluated
46
Effective sources
0
Scoring unit
Elo
Direction
Higher is better
Arena Text to Video Rating
Multimodal
Details →
Models evaluated
46
Effective sources
0
Scoring unit
Elo
Direction
Higher is better
MultiIF
Multilingual
Details →
Models evaluated
45
Effective sources
4
Scoring unit
%
Direction
Higher is better
CharXiv(RQ)
Multimodal
Details →
Models evaluated
44
Effective sources
17
Scoring unit
%
Direction
Higher is better
MATH 500
Reasoning
Details →
Models evaluated
44
Effective sources
4
Scoring unit
%
Direction
Higher is better
PolyMath
Multilingual
Details →
Models evaluated
44
Effective sources
4
Scoring unit
%
Direction
Higher is better
Creative Writing v3
Writing
Details →
Models evaluated
42
Effective sources
3
Scoring unit
%
Direction
Higher is better
LiveBench 20241125
Reasoning
Details →
Models evaluated
42
Effective sources
3
Scoring unit
%
Direction
Higher is better
SWE-bench Multilingual
Coding
Details →
Models evaluated
41
Effective sources
15
Scoring unit
%
Direction
Higher is better
NL2Repo
Coding
Details →
Models evaluated
40
Effective sources
20
Scoring unit
%
Direction
Higher is better
MMMLU
Reasoning
Details →
Models evaluated
40
Effective sources
4
Scoring unit
%
Direction
Higher is better
Arena-Hard
Conversation
Details →
Models evaluated
39
Effective sources
3
Scoring unit
%
Direction
Higher is better
ZebraLogic
Reasoning
Details →
Models evaluated
39
Effective sources
3
Scoring unit
%
Direction
Higher is better
MMMU-Pro
Multimodal
Details →
Models evaluated
38
Effective sources
12
Scoring unit
%
Direction
Higher is better
DeepSWE 1.1
Coding
Details →
Models evaluated
36
Effective sources
18
Scoring unit
%
Direction
Higher is better
OSWorld-Verified
Agents
Details →
Models evaluated
36
Effective sources
17
Scoring unit
%
Direction
Higher is better
IFBench
Reasoning
Details →
Models evaluated
36
Effective sources
12
Scoring unit
%
Direction
Higher is better
Terminal Bench 2.1 (Terminus-2)
Coding
Details →
Models evaluated
36
Effective sources
11
Scoring unit
%
Direction
Higher is better
Arena Image-to-WebDev Rating
Coding
Details →
Models evaluated
36
Effective sources
1
Scoring unit
Elo
Direction
Higher is better
LiveCodeBench v5
Coding
Details →
Models evaluated
36
Effective sources
1
Scoring unit
%
Direction
Higher is better
IMOAnswerBench
Reasoning
Details →
Models evaluated
35
Effective sources
15
Scoring unit
%
Direction
Higher is better
AlignBench v1.1
Conversation
Details →
Models evaluated
35
Effective sources
1
Scoring unit
score
Direction
Higher is better
AutoLogi
Reasoning
Details →
Models evaluated
35
Effective sources
1
Scoring unit
%
Direction
Higher is better
MLogiQA
Multilingual
Details →
Models evaluated
35
Effective sources
1
Scoring unit
%
Direction
Higher is better
MMMLU 14 languages
Multilingual
Details →
Models evaluated
35
Effective sources
1
Scoring unit
%
Direction
Higher is better
MT-AIME 2024
Multilingual
Details →
Models evaluated
35
Effective sources
1
Scoring unit
%
Direction
Higher is better
AA-LCR
Reasoning · Long context
Details →
Models evaluated
33
Effective sources
7
Scoring unit
%
Direction
Higher is better
Arena Document Rating
Long context
Details →
Models evaluated
33
Effective sources
1
Scoring unit
Elo
Direction
Higher is better
OmniDocBench 1.5
Multimodal
Details →
Models evaluated
32
Effective sources
12
Scoring unit
%
Direction
Higher is better
HMMT Nov. 2025
Reasoning
Details →
Models evaluated
32
Effective sources
9
Scoring unit
%
Direction
Higher is better
Page 1 of 12
1
2
3
4
5
…
More pages
12