跳到主内容
知行录
leaderboard.cn
Toggle Sidebar
搜索模型或厂商…
⌘K
分析
前沿模型
历史趋势
本地模型
模型对比
榜单工坊
资料库
模型库
模型价格
厂商
基准评测
数据源
设置
Toggle Sidebar
知行录
leaderboard.cn
正在加载页面内容
反馈
前沿模型
工坊
分享
按已收录评测数据和最新报告聚合,基于 Bradley-Terry / Elo 配对评分算法计算综合排名。
了解排名规则 →
前沿模型
229
收录模型
8
排名领域
508
聚合基准
122
数据源
更新于 09/05 05:02
总体
506 项基准
综合用户偏好、通用知识与指令遵循能力。
工坊
模型
评分
1
Claude Opus 5
100.0
2
GPT-6 Astra
99.2
3
Claude Fable 5
98.8
4
Muse Spark 1.3
98.5
5
Qwen3.8-Max
96.3
6
Kimi K3
96.0
7
GPT-5.6 Sol
95.9
8
Claude Fable 5.1
94.3
9
Gemini 3.8 Flash
91.2
10
GLM-5.3
91.0
开源
506 项基准
从总体榜筛选已标记为开源的模型,沿用总体榜原始 Elo 与相对顺序,并在本榜内归一化。
工坊
模型
评分
1
Kimi K3
100.0
2
GLM-5.3
94.8
3
Qwen3.8-2.4T-A95B
94.5
本地
506 项基准
从总体榜筛选已标记为开源且参数量小于 40B 的模型,沿用总体榜原始 Elo 与相对顺序,并在本榜内归一化。
工坊
模型
评分
1
Qwen3.8-27B
100.0
2
Qwen3.6-27B
89.7
3
Muse Glimmer 30B
88.7
代码
118 项基准
覆盖软件工程、竞赛编程和终端任务。
工坊
模型
评分
1
GPT-6 Astra
100.0
2
Claude Opus 5
99.7
3
Claude Fable 5
99.3
科研
140 项基准
偏科学知识、数学推理与研究型问题求解。
工坊
模型
评分
1
Claude Fable 5
100.0
2
Claude Opus 5
100.0
3
GPT-5.6 Sol
99.5
Agent
163 项基准
面向工具调用、网页浏览和长流程执行。
工坊
模型
评分
1
Claude Fable 5.1
100.0
2
Claude Fable 5
100.0
3
GPT-6 Astra
99.8
视觉
119 项基准
多模态理解、视觉数学、屏幕与视频任务。
工坊
模型
评分
1
Qwen3.8-Max
100.0
2
Claude Fable 5.1
99.3
3
GPT-6 Astra
94.3
长上下文
43 项基准
检索、归纳与百万级上下文推理。
工坊
模型
评分
1
GPT-6 Astra
100.0
2
Muse Spark 1.3
95.7
3
Claude Opus 5
91.9
更多领域
持续补充
样本较少的领域暂不展示模型排名。
查看基准
待补充领域
最低 3 项
文学
2 / 3
达到最低收录量后,该领域会自动加入首页排行。