跳到主内容
知行录
leaderboard.cn
Toggle Sidebar
搜索模型或厂商…
⌘K
分析
前沿模型
历史趋势
本地模型
模型对比
榜单工坊
资料库
模型库
模型价格
厂商
基准评测
数据源
设置
Toggle Sidebar
知行录
leaderboard.cn
正在加载页面内容
反馈
基准详情正在加载
返回基准目录
INCLUDE
多语言
分享
INCLUDE (Inclusive Benchmark) 由 AI2 等机构提出,旨在评测 LLM 在多样化和包容性场景下的表现。涵盖多语言、多文化背景和不同社会群体的知识,确保模型评估不偏向特定文化或语言群体。
排行
数据源
#
模型
得分
1
Gemini 2.5 Pro
Google
85.1
%
2
OpenAI o1
OpenAI
84.6
%
3
DeepSeek-R1
深度求索
82.7
%
4
Qwen3-235B-A22B-Thinking-2507
阿里巴巴
81.0
%
5
Llama 4 Maverick
Meta
80.9
%
6
Qwen3-235B-A22B-Instruct-2507
阿里巴巴
79.5
%
7
GPT-4o
OpenAI
78.8
%
8
Qwen3-235B-A22B
阿里巴巴
78.7
%
9
DeepSeek-V3
深度求索
76.7
%
10
DeepSeek-V3 Base
深度求索
75.2
%
共 69 个模型
1
2
3
4
5
6
7