跳到主内容
知行录
leaderboard.cn
Toggle Sidebar
搜索模型或厂商…
⌘K
分析
前沿模型
历史趋势
本地模型
模型对比
榜单工坊
资料库
模型库
模型价格
厂商
基准评测
数据源
设置
Toggle Sidebar
知行录
leaderboard.cn
正在加载页面内容
反馈
前沿模型
工坊
分享
按已收录评测数据和最新报告聚合,基于 Bradley-Terry / Elo 配对评分算法计算综合排名。
了解排名规则 →
前沿模型
215
收录模型
8
排名领域
470
聚合基准
85
数据源
更新于 08/12 01:31
总体
468 项基准
综合用户偏好、通用知识与指令遵循能力。
工坊
模型
评分
1
Claude Opus 5
100.0
2
Qwen3.8-Max
100.0
3
Claude Fable 5
99.5
4
Kimi K3
98.1
5
GPT-5.6 Sol
97.8
6
GPT-5.5
93.8
7
GPT-5.6 Terra
92.6
8
GPT-5.5 Pro
92.3
9
Claude Opus 4.8
91.4
10
DeepSeek-V4-Flash-0731
90.5
开源
273 项基准
仅聚合已标记为开源的模型,综合推理、编程、Agent、多模态与长上下文表现。
工坊
模型
评分
1
Kimi K3
100.0
2
DeepSeek-V4-Flash-0731
99.0
3
GLM-5.2
96.0
本地
122 项基准
可本地部署、参数量小于 40B 的前沿模型集合。
工坊
模型
评分
1
Qwen3.6-27B
100.0
2
Muse Glimmer 30B
95.1
3
Qwen3.5-27B
94.7
代码
104 项基准
覆盖软件工程、竞赛编程和终端任务。
工坊
模型
评分
1
Claude Fable 5
100.0
2
Claude Opus 5
96.0
3
GPT-5.6 Sol
95.9
科研
131 项基准
偏科学知识、数学推理与研究型问题求解。
工坊
模型
评分
1
Claude Opus 5
100.0
2
GPT-5.6 Sol
93.0
3
Claude Fable 5
92.3
Agent
137 项基准
面向工具调用、网页浏览和长流程执行。
工坊
模型
评分
1
Claude Fable 5
100.0
2
Kimi K3
97.1
3
GPT-5.6 Sol
96.7
视觉
108 项基准
多模态理解、视觉数学、屏幕与视频任务。
工坊
模型
评分
1
Qwen3.8-Max
100.0
2
Claude Opus 5
95.5
3
Seed2.1 Pro
90.7
长上下文
41 项基准
检索、归纳与百万级上下文推理。
工坊
模型
评分
1
Gemini 3.6 Flash
100.0
2
Muse Glimmer 30B
98.9
3
GPT-5.6 Sol
98.7
更多领域
持续补充
样本较少的领域暂不展示模型排名。
查看基准
待补充领域
最低 3 项
文学
2 / 3
达到最低收录量后,该领域会自动加入首页排行。