跳到主内容
知行录
leaderboard.cn
Toggle Sidebar
搜索模型或厂商…
⌘K
分析
前沿模型
历史趋势
本地模型
模型对比
榜单工坊
资料库
模型库
模型价格
厂商
基准评测
数据源
设置
Toggle Sidebar
知行录
leaderboard.cn
正在加载页面内容
反馈
正在加载页面内容
基准评测
浏览各评测基准及其在多模型上的评测数据。
基准列表
筛选
Arena Text Rating
推理
详情 →
参与模型
366 个
有效来源
1 个
计分单位
Elo
排序方向
越高越好
GPQA-Diamond
推理
详情 →
参与模型
131 个
有效来源
42 个
计分单位
%
排序方向
越高越好
Arena Vision Rating
多模态
详情 →
参与模型
130 个
有效来源
1 个
计分单位
Elo
排序方向
越高越好
MMLU-Redux
推理
详情 →
参与模型
102 个
有效来源
15 个
计分单位
%
排序方向
越高越好
Arena WebDev Rating
编程
详情 →
参与模型
98 个
有效来源
2 个
计分单位
Elo
排序方向
越高越好
MMLU-Pro
推理
详情 →
参与模型
96 个
有效来源
21 个
计分单位
%
排序方向
越高越好
Arena Text to Image Rating
多模态
详情 →
参与模型
79 个
有效来源
0 个
计分单位
Elo
排序方向
越高越好
INCLUDE
多语言
详情 →
参与模型
69 个
有效来源
4 个
计分单位
%
排序方向
越高越好
HLE (Humanity's Last Exam)
推理
详情 →
参与模型
67 个
有效来源
26 个
计分单位
%
排序方向
越高越好
SuperGPQA
推理
详情 →
参与模型
65 个
有效来源
13 个
计分单位
%
排序方向
越高越好
C-Eval
中文
详情 →
参与模型
64 个
有效来源
11 个
计分单位
%
排序方向
越高越好
SWE-bench Verified
编程
详情 →
参与模型
63 个
有效来源
22 个
计分单位
%
排序方向
越高越好
AIME 2025
推理
详情 →
参与模型
60 个
有效来源
8 个
计分单位
%
排序方向
越高越好
IFEval strict prompt
指令遵循
详情 →
参与模型
55 个
有效来源
7 个
计分单位
%
排序方向
越高越好
Arena Image Edit Rating
多模态
详情 →
参与模型
55 个
有效来源
0 个
计分单位
Elo
排序方向
越高越好
SWE-bench Pro
编程
详情 →
参与模型
53 个
有效来源
27 个
计分单位
%
排序方向
越高越好
AIME 2024
推理
详情 →
参与模型
51 个
有效来源
7 个
计分单位
%
排序方向
越高越好
LiveCodeBench-v6
推理
详情 →
参与模型
50 个
有效来源
17 个
计分单位
%
排序方向
越高越好
BFCL v3 Full
Agent
详情 →
参与模型
49 个
有效来源
5 个
计分单位
%
排序方向
越高越好
WritingBench
写作
详情 →
参与模型
47 个
有效来源
4 个
计分单位
%
排序方向
越高越好
MCP-Atlas
Agent
详情 →
参与模型
46 个
有效来源
20 个
计分单位
%
排序方向
越高越好
BrowseComp
Agent
详情 →
参与模型
46 个
有效来源
19 个
计分单位
%
排序方向
越高越好
MMLU
推理
详情 →
参与模型
46 个
有效来源
5 个
计分单位
%
排序方向
越高越好
HLE (w/ Tools)
推理 · Agent
详情 →
参与模型
45 个
有效来源
19 个
计分单位
%
排序方向
越高越好
MultiIF
多语言
详情 →
参与模型
45 个
有效来源
4 个
计分单位
%
排序方向
越高越好
MATH 500
推理
详情 →
参与模型
44 个
有效来源
4 个
计分单位
%
排序方向
越高越好
PolyMath
多语言
详情 →
参与模型
44 个
有效来源
4 个
计分单位
%
排序方向
越高越好
Arena Text to Video Rating
多模态
详情 →
参与模型
44 个
有效来源
0 个
计分单位
Elo
排序方向
越高越好
Arena Image to Video Rating
多模态
详情 →
参与模型
43 个
有效来源
0 个
计分单位
Elo
排序方向
越高越好
Creative Writing v3
写作
详情 →
参与模型
42 个
有效来源
3 个
计分单位
%
排序方向
越高越好
LiveBench 20241125
推理
详情 →
参与模型
42 个
有效来源
3 个
计分单位
%
排序方向
越高越好
CharXiv(RQ)
多模态
详情 →
参与模型
41 个
有效来源
15 个
计分单位
%
排序方向
越高越好
Arena Agent Bash Recovery
Agent
详情 →
参与模型
41 个
有效来源
1 个
计分单位
%
排序方向
越高越好
Arena Agent Confirmed Success
Agent
详情 →
参与模型
41 个
有效来源
1 个
计分单位
%
排序方向
越高越好
Arena Agent Net Improvement
Agent
详情 →
参与模型
41 个
有效来源
1 个
计分单位
%
排序方向
越高越好
Arena Agent Praise vs Complaint
Agent
详情 →
参与模型
41 个
有效来源
1 个
计分单位
%
排序方向
越高越好
Arena Agent Steerability
Agent
详情 →
参与模型
41 个
有效来源
1 个
计分单位
%
排序方向
越高越好
Arena Agent Tool Hallucination
Agent
详情 →
参与模型
41 个
有效来源
1 个
计分单位
%
排序方向
越高越好
MMMLU
推理
详情 →
参与模型
40 个
有效来源
4 个
计分单位
%
排序方向
越高越好
SWE-bench Multilingual
编程
详情 →
参与模型
39 个
有效来源
14 个
计分单位
%
排序方向
越高越好
Arena-Hard
对话
详情 →
参与模型
39 个
有效来源
3 个
计分单位
%
排序方向
越高越好
ZebraLogic
推理
详情 →
参与模型
39 个
有效来源
3 个
计分单位
%
排序方向
越高越好
MMMU-Pro
多模态
详情 →
参与模型
37 个
有效来源
11 个
计分单位
%
排序方向
越高越好
OSWorld-Verified
Agent
详情 →
参与模型
36 个
有效来源
17 个
计分单位
%
排序方向
越高越好
LiveCodeBench v5
编程
详情 →
参与模型
36 个
有效来源
1 个
计分单位
%
排序方向
越高越好
IMOAnswerBench
推理
详情 →
参与模型
35 个
有效来源
15 个
计分单位
%
排序方向
越高越好
AlignBench v1.1
对话
详情 →
参与模型
35 个
有效来源
1 个
计分单位
score
排序方向
越高越好
AutoLogi
推理
详情 →
参与模型
35 个
有效来源
1 个
计分单位
%
排序方向
越高越好
MLogiQA
多语言
详情 →
参与模型
35 个
有效来源
1 个
计分单位
%
排序方向
越高越好
MMMLU 14 languages
多语言
详情 →
参与模型
35 个
有效来源
1 个
计分单位
%
排序方向
越高越好
MT-AIME 2024
多语言
详情 →
参与模型
35 个
有效来源
1 个
计分单位
%
排序方向
越高越好
NL2Repo
编程
详情 →
参与模型
34 个
有效来源
16 个
计分单位
%
排序方向
越高越好
IFBench
推理
详情 →
参与模型
34 个
有效来源
11 个
计分单位
%
排序方向
越高越好
Arena Image-to-WebDev Rating
编程
详情 →
参与模型
34 个
有效来源
1 个
计分单位
Elo
排序方向
越高越好
Terminal Bench 2.1 (Terminus-2)
编程
详情 →
参与模型
33 个
有效来源
10 个
计分单位
%
排序方向
越高越好
AA-LCR
推理 · 长上下文
详情 →
参与模型
33 个
有效来源
7 个
计分单位
%
排序方向
越高越好
Arena Document Rating
长上下文
详情 →
参与模型
33 个
有效来源
1 个
计分单位
Elo
排序方向
越高越好
OmniDocBench 1.5
多模态
详情 →
参与模型
32 个
有效来源
12 个
计分单位
%
排序方向
越高越好
HMMT Nov. 2025
推理
详情 →
参与模型
32 个
有效来源
9 个
计分单位
%
排序方向
越高越好
MultiPL-E
编程
详情 →
参与模型
31 个
有效来源
3 个
计分单位
%
排序方向
越高越好
第 1 / 11 页
1
2
3
4
5
…
更多页
11