跳到主内容
知行录
leaderboard.cn
Toggle Sidebar
搜索模型或厂商…
⌘K
分析
前沿模型
历史趋势
本地模型
模型对比
榜单工坊
资料库
模型库
模型价格
厂商
基准评测
数据源
设置
Toggle Sidebar
知行录
leaderboard.cn
正在加载页面内容
反馈
基准详情正在加载
返回基准目录
QwenClawBench
编程
分享
官方网站
QwenClawBench 是通义千问团队推出的命令行代理评测基准,评估 AI 在终端环境中的任务完成能力。涵盖文件操作、系统管理、代码构建和网络配置等场景,为衡量 AI CLI 代理能力提供标准化测试集。
排行
数据源
#
模型
得分
1
Claude Opus 4.6
Anthropic
65.5
%
2
Qwen3.7-Max
阿里巴巴
64.3
%
3
Qwen3.7-Plus
阿里巴巴
61.8
%
4
DeepSeek-V4-Pro
深度求索
59.2
%
5
GLM-5.1
智谱AI
58.7
%
6
Qwen3.6-Plus
阿里巴巴
57.2
%
7
Kimi-K2.6
月之暗面
54.7
%
8
Kimi-K2.5
月之暗面
54.3
%
9
GLM-5
智谱AI
54.1
%
10
Qwen3.6-27B
阿里巴巴
53.4
%
共 14 个模型
1
2