跳到主内容
知行录
leaderboard.cn
Toggle Sidebar
搜索模型或厂商…
⌘K
分析
前沿模型
历史趋势
本地模型
模型对比
榜单工坊
资料库
模型库
模型价格
厂商
基准评测
数据源
设置
Toggle Sidebar
知行录
leaderboard.cn
正在加载页面内容
反馈
基准详情正在加载
返回基准目录
MMLU
推理
分享
官方网站
MMLU (Massive Multitask Language Understanding) 由 Dan Hendrycks 等人于 2020 年提出(ICLR 2021),覆盖 57 个学科从基础数学、美国历史、计算机科学到法律和医学。采用多项选择题格式,是衡量 LLM 广泛世界知识和问题解决能力的最经典基准之一。
排行
数据源
#
模型
得分
1
OpenAI o1
OpenAI
91.8
%
2
GPT-4.5
OpenAI
90.8
%
3
DeepSeek-R1
深度求索
90.8
%
4
GPT-4.1
OpenAI
90.2
%
5
DeepSeek-V4-Pro Base
深度求索
90.1
%
6
MiMo-V2.5-Pro Base
小米
89.4
%
7
DeepSeek-V4-Flash Base
深度求索
88.7
%
8
Llama 3.1 405B Instruct
Meta
88.6
%
9
DeepSeek-V3
深度求索
88.5
%
10
Claude 3.5 Sonnet 20241022
Anthropic
88.3
%
共 46 个模型
1
2
3
4
5