跳到主内容
知行录
leaderboard.cn
Toggle Sidebar
搜索模型或厂商…
⌘K
分析
前沿模型
历史趋势
本地模型
模型对比
榜单工坊
资料库
模型库
模型价格
厂商
基准评测
数据源
设置
Toggle Sidebar
知行录
leaderboard.cn
正在加载页面内容
反馈
基准详情正在加载
返回基准目录
MMLU-Pro
推理
分享
官方网站
MMLU 升级版, 更难的 12000+ 道题
MMLU-Pro 是 MMLU 的增强版,由多伦多大学等单位于 2024 年提出。通过增加选项数量(由 4 个增至 10 个)、过滤掉容易被猜对的题目并增加推理类问题,使基准难度大幅提升,更可靠地区分模型性能。GPT-4 准确率从 MMLU 的 86% 降至约 60-70%。
排行
数据源
#
模型
得分
1
Gemini 3.1 Pro
Google
91.0
%
2
Gemini 3 Pro
Google
90.1
%
3
Claude Opus 4.6
Anthropic
89.7
%
4
Qwen3.7-Max
阿里巴巴
89.6
%
5
Claude Opus 4.5
Anthropic
89.5
%
6
Qwen3.6-Plus
阿里巴巴
88.5
%
7
Qwen3.7-Plus
阿里巴巴
88.5
%
8
Qwen3.5-397B-A17B
阿里巴巴
88.3
%
9
Claude Sonnet 4.5
Anthropic
88.2
%
10
Kimi-K2.6
月之暗面
88.1
%
共 96 个模型
1
2
3
4
5
…
更多页
10