Skip to main content
leaderboard
.cn
Toggle Sidebar
Search models or organizations…
⌘K
Explore
Frontier Models
Historical Trends
Local Models
Compare Models
Ranking Studio
Library
Models
Pricing
Organizations
Benchmarks
Data sources
Settings
Toggle Sidebar
leaderboard
.cn
Loading page content
Feedback
Loading page content
Back to models
o3-mini
Closed
Share
Add to comparison
Tool use · Reasoning
Overview
Evaluations
Evaluation overview
Overall rank
#104
65.4 points · 180 models
Coding rank
#83
69.1 points · 160 models
Data coverage
43 items
3 sources · updated through 2026-07-16
Domain performance
Coding
#83 / 160
69.1
Research
#91 / 174
77.1
Agents
#101 / 125
57.3
Long context
#74 / 82
59
Evaluation highlights
All evaluations
AIME 2024
Reasoning · OpenAI GPT-4.1 Release
87.3%
4
/ 51
LiveCodeBench v5
Coding · Qwen3 Technical Report
66.3%
4
/ 36
IFEval
Instruction following · OpenAI GPT-4.1 Release
93.9%
8
/ 30
BFCL v3 Full
Agents · Qwen3 Technical Report
64.6%
22
/ 49
Graphwalks parents 0K-128K (accuracy)
Long context · OpenAI GPT-4.1 Release
58.3%
10
/ 18
MultiIF
Multilingual · OpenAI GPT-4.1 Release
79.5%
2
/ 45
Basic information
Context (input / output)
200K / 100K
Release date
2025-01
Input modalities
Text
Output modalities
Text
Related links
Official site
Version relationships
Runtime modes
High