跳到主内容
知行录
leaderboard.cn
Toggle Sidebar
搜索模型或厂商…
⌘K
分析
前沿模型
历史趋势
本地模型
模型对比
榜单工坊
资料库
模型库
模型价格
厂商
基准评测
数据源
设置
Toggle Sidebar
知行录
leaderboard.cn
正在加载页面内容
反馈
基准详情正在加载
返回基准目录
FrontierSWE (Dominance)
编程
分享
官方网站
Proximal 评估, 1M 上下文, max effort, 128K 输出 tokens
FrontierSWE 评估前沿 AI 模型的软件工程能力,聚焦最先进的模型能否解决极具挑战性的真实世界编程问题。任务设计参考了顶级程序员在真实工作中的难度水平,是衡量 AI 编程能力天花板的权威基准。
排行
数据源
#
模型
得分
1
Claude Fable 5
Anthropic
88.8
%
2
Kimi K3
月之暗面
81.2
%
3
GLM-5.3
智谱AI
78.1
%
4
Claude Opus 4.8
Anthropic
75.1
%
5
GLM-5.2
智谱AI
74.4
%
6
Qwen3.8-2.4T-A95B
阿里巴巴
73.5
%
7
Qwen3.8-Max
阿里巴巴
73.5
%
8
GPT-5.5
OpenAI
72.6
%
9
GPT-5.6 Sol
OpenAI
71.3
%
10
Qwen3.7-Max
阿里巴巴
40.7
%
共 13 个模型
1
2