Skip to main content
leaderboard
.cn
Toggle Sidebar
Search models or organizations…
⌘K
Explore
Frontier Models
Historical Trends
Local Models
Compare Models
Ranking Studio
Library
Models
Pricing
Organizations
Benchmarks
Data sources
Settings
Toggle Sidebar
leaderboard
.cn
Loading page content
Feedback
Loading page content
Back to models
Grok-3-Beta Thinking
Closed
Share
Add to comparison
Tool use · Reasoning
Overview
Evaluations
Evaluation overview
Overall rank
#76
69.4 points · 180 models
Research rank
#75
79.6 points · 174 models
Data coverage
4 items
1 source · updated through 2025-05-14
Domain performance
Coding
#79 / 160
69.9
Research
#75 / 174
79.6
Evaluation highlights
All evaluations
LiveCodeBench v5
Coding · Qwen3 Technical Report
70.6%
2
/ 36
AIME 2024
Reasoning · Qwen3 Technical Report
83.9%
7
/ 51
AIME 2025
Reasoning · Qwen3 Technical Report
77.3%
22
/ 60
GPQA-Diamond
Reasoning · Qwen3 Technical Report
80.2%
61
/ 126
Basic information
Release date
2025-02
Input modalities
Text
Output modalities
Text
Evaluation source
Qwen3 Technical Report