Skip to main content
leaderboard
.cn
Toggle Sidebar
Search models or organizations…
⌘K
Explore
Frontier Models
Historical Trends
Local Models
Compare Models
Ranking Studio
Library
Models
Pricing
Organizations
Benchmarks
Data sources
Settings
Toggle Sidebar
leaderboard
.cn
Loading page content
Feedback
Benchmark details loading
Back to benchmarks
Arena Agent Confirmed Success
Agents
Share
Results for 52 models collected from 4 public sources.
Ranking
Sources
#
Model
Score
1
Claude Opus 5
Anthropic · Max mode
18.1
%
2
Claude Fable 5
Anthropic · High mode
17.3
%
3
Kimi K3
Moonshot · Max mode
16.9
%
4
GLM-5.3-Flash
Zhipu AI
14.6
%
5
DeepSeek-V4-Pro-0813
DeepSeek · High / Agent mode
13.1
%
6
GLM-5.3
Z.ai · Max mode
12.4
%
7
Qwen3.8-Flash-Next
Alibaba
11.9
%
8
Gemini 3.8 Flash
Google · High mode
11.1
%
9
GPT-5.6 Sol
OpenAI · xHigh mode
10.9
%
10
Grok 4.6
SpaceXAI · xHigh mode
10.6
%
52 models total
1
2
3
4
5
6