跳到主内容
知行录
leaderboard.cn
Toggle Sidebar
搜索模型或厂商…
⌘K
分析
前沿模型
历史趋势
本地模型
模型对比
榜单工坊
资料库
模型库
模型价格
厂商
基准评测
数据源
设置
Toggle Sidebar
知行录
leaderboard.cn
正在加载页面内容
反馈
前沿模型
工坊
分享
按已收录评测数据和最新报告聚合,基于 Bradley-Terry / Elo 配对评分算法计算综合排名。
了解排名规则 →
前沿模型
230
收录模型
8
排名领域
509
聚合基准
123
数据源
更新于 09/10 21:09
总体
507 项基准
综合用户偏好、通用知识与指令遵循能力。
工坊
模型
评分
1
Claude Opus 5
100.0
2
GPT-6 Astra
99.2
3
Claude Fable 5
98.8
4
Muse Spark 1.3
98.2
5
Qwen3.8-Max
96.2
6
GPT-5.6 Sol
96.0
7
Kimi K3
95.8
8
Claude Fable 5.1
94.5
9
DeepSeek-V4.1-Flash
91.3
10
Gemini 3.8 Flash
91.1
开源
507 项基准
从总体榜筛选已标记为开源的模型,沿用总体榜原始 Elo 与相对顺序,并在本榜内归一化。
工坊
模型
评分
1
Kimi K3
100.0
2
DeepSeek-V4.1-Flash
95.3
3
GLM-5.3
94.8
本地
507 项基准
从总体榜筛选已标记为开源且参数量小于 40B 的模型,沿用总体榜原始 Elo 与相对顺序,并在本榜内归一化。
工坊
模型
评分
1
Qwen3.8-27B
100.0
2
Qwen3.6-27B
89.8
3
Muse Glimmer 30B
88.8
代码
118 项基准
覆盖软件工程、竞赛编程和终端任务。
工坊
模型
评分
1
GPT-6 Astra
100.0
2
Claude Opus 5
99.9
3
Claude Fable 5
99.5
科研
141 项基准
偏科学知识、数学推理与研究型问题求解。
工坊
模型
评分
1
Claude Opus 5
100.0
2
Claude Fable 5
100.0
3
GPT-5.6 Sol
99.5
Agent
164 项基准
面向工具调用、网页浏览和长流程执行。
工坊
模型
评分
1
Claude Fable 5.1
100.0
2
GPT-6 Astra
99.9
3
Claude Fable 5
99.6
视觉
120 项基准
多模态理解、视觉数学、屏幕与视频任务。
工坊
模型
评分
1
Qwen3.8-Max
100.0
2
Claude Fable 5.1
99.4
3
GPT-6 Astra
94.3
长上下文
43 项基准
检索、归纳与百万级上下文推理。
工坊
模型
评分
1
GPT-6 Astra
100.0
2
Muse Spark 1.3
95.7
3
Claude Opus 5
91.9
更多领域
持续补充
样本较少的领域暂不展示模型排名。
查看基准
待补充领域
最低 3 项
文学
2 / 3
达到最低收录量后,该领域会自动加入首页排行。