跳到主内容
知行录
leaderboard.cn
Toggle Sidebar
搜索模型或厂商…
⌘K
分析
前沿模型
历史趋势
本地模型
模型对比
榜单工坊
资料库
模型库
模型价格
厂商
基准评测
数据源
设置
Toggle Sidebar
知行录
leaderboard.cn
正在加载页面内容
反馈
基准详情正在加载
返回基准目录
MLE-Bench (Partial 30)
编程
Agent
分享
官方网站
官方自测 MLE-Bench Partial 30,报告 k=2 次独立运行的平均 Position Score。
排行
数据源
#
模型
得分
1
Claude Sonnet 5
Anthropic
66.9
%
2
Gemini 3.6 Flash
Google
63.9
%
3
Gemini 3.5 Flash
Google
49.7
%
4
GPT-5.6 Luna
OpenAI
47.6
%
5
Grok 4.5
xAI
43.2
%
6
Gemini 3.1 Pro
Google
42.6
%
共 6 个模型