跳到主内容
知行录
leaderboard.cn
Toggle Sidebar
搜索模型或厂商…
⌘K
分析
前沿模型
历史趋势
本地模型
模型对比
榜单工坊
资料库
模型库
模型价格
厂商
基准评测
数据源
设置
Toggle Sidebar
知行录
leaderboard.cn
正在加载页面内容
反馈
基准详情正在加载
返回基准目录
HealthBench Professional
推理
分享
官方网站
HealthBench 由多个医疗 AI 研究机构联合推出,评测 AI 在医疗领域的专业知识应用能力。Professional 子集包含执业医师考试级问题,涵盖诊断推理、治疗方案选择、药物相互作用等临床场景。评估模型在专业医疗知识上的深度和准确性。
排行
数据源
#
模型
得分
1
Claude Fable 5
Anthropic
66.0
%
2
Claude Mythos Preview
Anthropic
64.7
%
3
GPT-5.6 Sol
OpenAI
60.5
%
4
Claude Opus 5
Anthropic
59.8
%
5
Muse Spark 1.1
Meta
59.3
%
6
GPT-5.6 Terra
OpenAI
57.7
%
7
Claude Opus 4.8
Anthropic
57.4
%
8
GPT-5.6 Luna
OpenAI
55.7
%
9
Muse Spark
Meta
54.1
%
10
GPT-5.5
OpenAI
51.8
%
共 11 个模型
1
2