跳到主内容
知行录
leaderboard.cn
Toggle Sidebar
搜索模型或厂商…
⌘K
分析
前沿模型
历史趋势
本地模型
模型对比
榜单工坊
资料库
模型库
模型价格
厂商
基准评测
数据源
设置
Toggle Sidebar
知行录
leaderboard.cn
正在加载页面内容
反馈
基准详情正在加载
返回基准目录
SURDS
多模态
分享
SURDS (Scene Understanding and Reasoning Dataset) 是场景理解与推理基准,评测 AI 在复杂场景中理解物体交互、人物动作和环境上下文的能力。包含需要多步推理的场景问答和反事实推理问题,测试模型对视觉场景的深层理解。
排行
数据源
#
模型
得分
1
Claude Fable 5
Anthropic
79.4
%
2
Qwen3.8-Max
阿里巴巴
77.8
%
3
Qwen3.7-Plus
阿里巴巴
77.2
%
4
Qwen3.6-Plus
阿里巴巴
73.2
%
5
Gemini 3.1 Pro
Google
64.0
%
6
GPT-5.6 Sol
OpenAI
63.0
%
7
Claude Opus 4.8
Anthropic
62.2
%
8
Claude Opus 4.6
Anthropic
58.3
%
共 8 个模型