跳到主内容
知行录
leaderboard.cn
Toggle Sidebar
搜索模型或厂商…
⌘K
分析
前沿模型
历史趋势
本地模型
模型对比
榜单工坊
资料库
模型库
模型价格
厂商
基准评测
数据源
设置
Toggle Sidebar
知行录
leaderboard.cn
正在加载页面内容
反馈
基准详情正在加载
返回基准目录
CL-bench
编程
长上下文
分享
CL-Bench(Claw Benchmark)是评估 AI 在命令行界面工具使用能力的基准。模型需正确调用各种 CLI 工具完成文件操作、数据处理、系统配置等任务,测试 AI 对 Unix/Linux 命令行生态的掌握程度。
排行
数据源
#
模型
得分
1
GPT-5.5
OpenAI
27.8
%
2
Claude Opus 4.8
Anthropic
24.8
%
3
混元3
腾讯
23.8
%
4
Seed2.1 Pro
字节跳动
23.5
%
5
GLM-5.2
智谱AI
23.1
%
6
Claude Opus 4.7
Anthropic
22.9
%
7
混元3 Preview
腾讯
22.8
%
8
Gemini 3.1 Pro
Google
21.3
%
9
GLM-5.1
智谱AI
21.0
%
10
MiniMax M3
MiniMax
20.5
%
共 14 个模型
1
2