跳到主内容
知行录
leaderboard.cn
Toggle Sidebar
搜索模型或厂商…
⌘K
分析
前沿模型
历史趋势
本地模型
模型对比
榜单工坊
资料库
模型库
模型价格
厂商
基准评测
数据源
设置
Toggle Sidebar
知行录
leaderboard.cn
正在加载页面内容
反馈
基准详情正在加载
返回基准目录
ClawEval
编程
分享
官方网站
ClawEval 评估 AI 使用命令行工具和编程接口的综合能力。模型需在真实终端环境中完成多步骤任务,通过 CLAW(Command Line Agent Workflow)框架标准化评测,是衡量 AI 终端代理能力的重要基准。
排行
数据源
#
模型
得分
1
Claude Opus 4.6
Anthropic
70.4
%
2
Qwen3.7-Max
阿里巴巴
65.2
%
3
GLM-5.1
智谱AI
62.7
%
4
Qwen3.7-Plus
阿里巴巴
62.7
%
5
Kimi-K2.6
月之暗面
61.5
%
6
DeepSeek-V4-Pro
深度求索
58.4
%
7
Qwen3.6-Plus
阿里巴巴
57.1
%
共 7 个模型