跳到主内容
知行录
leaderboard.cn
Toggle Sidebar
搜索模型或厂商…
⌘K
分析
前沿模型
历史趋势
本地模型
模型对比
榜单工坊
资料库
模型库
模型价格
厂商
基准评测
数据源
设置
Toggle Sidebar
知行录
leaderboard.cn
正在加载页面内容
反馈
基准详情正在加载
返回基准目录
Terminal Bench 2.1 (Best Harness)
编程
分享
官方网站
Claude Code 2.1.167, max_new_tokens=128k, 5 次取平均
Terminal-Bench Best 是 Terminal-Bench 评测中按最佳性能指标聚合的分数,反映模型在终端任务上的最优表现。涵盖软件工程、机器学习、安全和数据科学等多个领域的终端操作能力全面评估。
排行
数据源
#
模型
得分
1
GPT-5.6 Sol
OpenAI
88.8
%
2
Kimi K3
月之暗面
88.3
%
3
Claude Fable 5
Anthropic
88.0
%
4
Qwen3.8-2.4T-A95B
阿里巴巴
86.6
%
5
Qwen3.8-Max
阿里巴巴
86.6
%
6
Claude Opus 4.8
Anthropic
84.6
%
7
GPT-5.5
OpenAI
83.4
%
8
GLM-5.2
智谱AI
82.7
%
9
Qwen3.7-Max
阿里巴巴
74.5
%
10
Gemini 3.1 Pro
Google
70.7
%
共 11 个模型
1
2