跳到主内容
知行录
leaderboard.cn
Toggle Sidebar
搜索模型或厂商…
⌘K
分析
前沿模型
历史趋势
本地模型
模型对比
榜单工坊
资料库
模型库
模型价格
厂商
基准评测
数据源
设置
Toggle Sidebar
知行录
leaderboard.cn
正在加载页面内容
反馈
基准详情正在加载
返回基准目录
BioMysteryBench (human solved)
推理
分享
BioMysteryBench Human 子集使用人类生物学专家标注和验证的题目,作为 AI 性能的参照基准。通过对比 AI 与人类专家的表现,评估模型在复杂生物学推理上的相对水平。
排行
数据源
#
模型
得分
1
Claude Opus 5
Anthropic
90.1
%
2
Claude Opus 4.8
Anthropic
88.5
%
3
Claude Sonnet 5
Anthropic
87.5
%
4
Gemini 3.7 Flash
Google
87.1
%
5
Claude Fable 5
Anthropic
83.9
%
6
GPT-5.6 Terra
OpenAI
83.8
%
7
Claude Mythos Preview
Anthropic
82.6
%
8
Gemini 3.6 Flash
Google
80.6
%
共 8 个模型