Skip to main content
leaderboard
.cn
Toggle Sidebar
Search models or organizations…
⌘K
Explore
Frontier Models
Historical Trends
Local Models
Compare Models
Ranking Studio
Library
Models
Pricing
Organizations
Benchmarks
Data sources
Settings
Toggle Sidebar
leaderboard
.cn
Loading page content
Feedback
Benchmark details loading
Back to benchmarks
Frontier-Bench v0.1
Coding
Share
Anthropic internal evaluation using mini-SWE-agent with a GKE backend. Scores are the mean reward across five attempts per task. Safety-classifier refusals from Opus 5 and Fable 5 fall back to Opus 4.8.
Ranking
Sources
#
Model
Score
1
Claude Opus 5
Anthropic
43.3
%
2
GPT-5.6 Sol
OpenAI
34.4
%
3
Claude Fable 5
Anthropic
33.7
%
4
Claude Opus 4.8
Anthropic
21.1
%
4 models total