跳到主内容
知行录
leaderboard.cn
Toggle Sidebar
搜索模型或厂商…
⌘K
分析
前沿模型
历史趋势
本地模型
模型对比
榜单工坊
资料库
模型库
模型价格
厂商
基准评测
数据源
设置
Toggle Sidebar
知行录
leaderboard.cn
正在加载页面内容
反馈
前沿模型
工坊
分享
按已收录评测数据和最新报告聚合,基于 Bradley-Terry / Elo 配对评分算法计算综合排名。
了解排名规则 →
前沿模型
213
收录模型
8
排名领域
462
聚合基准
83
数据源
更新于 08/03 13:09
总体
460 项基准
综合用户偏好、通用知识与指令遵循能力。
工坊
模型
评分
1
Claude Opus 5
100.0
2
Qwen3.8-Max
99.5
3
Claude Fable 5
99.2
4
Kimi K3
97.7
5
GPT-5.6 Sol
97.4
6
GPT-5.5
93.3
7
GPT-5.6 Terra
92.2
8
GPT-5.5 Pro
92.0
9
Claude Opus 4.8
90.9
10
DeepSeek-V4-Flash-0731
90.1
开源
264 项基准
仅聚合已标记为开源的模型,综合推理、编程、Agent、多模态与长上下文表现。
工坊
模型
评分
1
Kimi K3
100.0
2
DeepSeek-V4-Flash-0731
99.4
3
GLM-5.2
95.9
本地
107 项基准
可本地部署、参数量小于 40B 的前沿模型集合。
工坊
模型
评分
1
Qwen3.6-27B
100.0
2
Qwen3.5-27B
93.8
3
Qwen3.6-35B-A3B
93.2
代码
104 项基准
覆盖软件工程、竞赛编程和终端任务。
工坊
模型
评分
1
Claude Fable 5
100.0
2
Claude Opus 5
95.9
3
GPT-5.6 Sol
95.8
科研
131 项基准
偏科学知识、数学推理与研究型问题求解。
工坊
模型
评分
1
Claude Opus 5
100.0
2
GPT-5.6 Sol
92.0
3
Claude Fable 5
91.5
Agent
130 项基准
面向工具调用、网页浏览和长流程执行。
工坊
模型
评分
1
Claude Fable 5
100.0
2
Kimi K3
97.2
3
GPT-5.6 Sol
96.7
视觉
108 项基准
多模态理解、视觉数学、屏幕与视频任务。
工坊
模型
评分
1
Qwen3.8-Max
100.0
2
Claude Opus 5
95.4
3
Seed2.1 Pro
90.7
长上下文
40 项基准
检索、归纳与百万级上下文推理。
工坊
模型
评分
1
Gemini 3.6 Flash
100.0
2
GPT-5.6 Sol
98.7
3
Claude Opus 4.6
97.9
更多领域
持续补充
样本较少的领域暂不展示模型排名。
查看基准
待补充领域
最低 3 项
文学
2 / 3
达到最低收录量后,该领域会自动加入首页排行。