跳到主内容
知行录
leaderboard.cn
Toggle Sidebar
搜索模型或厂商…
⌘K
分析
前沿模型
历史趋势
本地模型
模型对比
榜单工坊
资料库
模型库
模型价格
厂商
基准评测
数据源
设置
Toggle Sidebar
知行录
leaderboard.cn
正在加载页面内容
反馈
基准详情正在加载
返回基准目录
MMBench EN-DEV v1.1
多模态
分享
官方网站
MMBench EN-DEV v1.1 是 OpenLab 提出的多模态综合评测基准英文版,涵盖感知、推理、知识、计算等多个维度 3000+ 道题目。使用 ChatGPT 辅助构建 QA 对并验证,是目前多模态模型评测中使用最广泛的中英文双语基准之一。
排行
数据源
#
模型
得分
1
Qwen3.5-397B-A17B
阿里巴巴
93.7
%
2
Gemini 3 Pro
Google
93.7
%
3
Qwen3.6-35B-A3B
阿里巴巴
92.8
%
4
Qwen3.6-27B
阿里巴巴
92.3
%
5
Qwen3.5-35B-A3B
阿里巴巴
91.5
%
6
Claude Opus 4.5
Anthropic
89.2
%
7
Claude Sonnet 4.5
Anthropic
88.3
%
8
GPT-5.2
OpenAI
88.2
%
共 8 个模型