跳到主内容
知行录
leaderboard.cn
Toggle Sidebar
搜索模型或厂商…
⌘K
分析
前沿模型
历史趋势
本地模型
模型对比
榜单工坊
资料库
模型库
模型价格
厂商
基准评测
数据源
设置
Toggle Sidebar
知行录
leaderboard.cn
正在加载页面内容
反馈
基准详情正在加载
返回基准目录
GPQA-Diamond
推理
分享
官方网站
GPQA (Graduate-Level Google-Proof Q&A) 由纽约大学等单位于 2023 年发布,包含 448 道由生物、物理、化学领域博士级专家编写的高难度选择题。问题设计为「谷歌无法回答」——即使开放网络搜索,非专家准确率仅 34%,专家达 65%。GPT-4 仅 39%,是评估 AI 科学知识与推理深度的关键基准。
排行
数据源
#
模型
得分
1
GPT-5.6 Sol
OpenAI
94.6
%
2
Claude Mythos Preview
Anthropic
94.6
%
3
GPT-5.4 Pro
OpenAI
94.4
%
4
Gemini 3.1 Pro
Google
94.3
%
5
Claude Opus 4.7
Anthropic
94.2
%
6
Claude Opus 4.8
Anthropic
93.6
%
7
GPT-5.5
OpenAI
93.6
%
8
Kimi K3
月之暗面
93.5
%
9
GPT-5.2 Pro
OpenAI
93.2
%
10
MiniMax M3
MiniMax
93.0
%
共 133 个模型
1
2
3
4
5
…
更多页
14