Skip to main content
leaderboard
.cn
Toggle Sidebar
Search models or organizations…
⌘K
Explore
Frontier Models
Historical Trends
Local Models
Compare Models
Ranking Studio
Library
Models
Pricing
Organizations
Benchmarks
Data sources
Settings
Toggle Sidebar
leaderboard
.cn
Loading page content
Feedback
Loading page content
Back to models
Grok-3-Beta Thinking
Closed
Share
Add to comparison
Tool use · Reasoning
Overview
Evaluations
Evaluation overview
Overall rank
#93
70.1 points · 202 models
Research rank
#95
78.8 points · 196 models
Data coverage
4 items
1 source · updated through 2025-05-14
Domain performance
Coding
#100 / 182
66.2
Research
#95 / 196
78.8
Evaluation highlights
All evaluations
LiveCodeBench v5
Coding · Qwen3 Technical Report
70.6%
2
/ 36
AIME 2024
Reasoning · Qwen3 Technical Report
83.9%
7
/ 51
AIME 2025
Reasoning · Qwen3 Technical Report
77.3%
22
/ 60
GPQA-Diamond
Reasoning · Qwen3 Technical Report
80.2%
72
/ 138
Basic information
Release date
2025-02
Input modalities
Text
Output modalities
Text
Evaluation source
Qwen3 Technical Report