跳到主内容
知行录
leaderboard.cn
Toggle Sidebar
搜索模型或厂商…
⌘K
分析
前沿模型
历史趋势
本地模型
模型对比
榜单工坊
资料库
模型库
模型价格
厂商
基准评测
数据源
设置
Toggle Sidebar
知行录
leaderboard.cn
正在加载页面内容
反馈
基准详情正在加载
返回基准目录
HLE (Humanity's Last Exam)
推理
分享
官方网站
temperature=1.0, top_p=0.95, max=163840 tokens, 默认 text-only 子集
Humanity's Last Exam (HLE) 是由 CAIS 与 Scale AI 于 2025 年发布的极难评测集,包含约 2500 道来自数学、物理、化学、生物、历史、法律等多领域的高难度题目。格式为多项选择和自由回答,旨在衡量 AI 在人类专家级别知识上的极限表现,被称为「人类的最后考试」。
排行
数据源
#
模型
得分
1
Claude Fable 5
Anthropic
53.3
%
2
Claude Opus 4.8
Anthropic
49.8
%
3
GPT-5.6 Sol
OpenAI
47.2
%
4
GPT-5.5
OpenAI
46.9
%
5
Claude Opus 4.7
Anthropic
46.9
%
6
Gemini 3.1 Pro
Google
45.0
%
7
Qwen3.8-2.4T-A95B
阿里巴巴
43.6
%
8
Qwen3.8-Max
阿里巴巴
43.6
%
9
Kimi K3
月之暗面
43.5
%
10
GPT-5.5 Pro
OpenAI
43.1
%
共 69 个模型
1
2
3
4
5
6
7