跳到主内容
知行录
leaderboard.cn
Toggle Sidebar
搜索模型或厂商…
⌘K
分析
前沿模型
历史趋势
本地模型
模型对比
榜单工坊
资料库
模型库
模型价格
厂商
基准评测
数据源
设置
Toggle Sidebar
知行录
leaderboard.cn
正在加载页面内容
反馈
基准详情正在加载
返回基准目录
Claw Eval (pass^3)
编程
Agent
分享
Kimi Claw 评估基准的另一命名,同样使用 Pass@3 指标。测试 AI Agent 在真实桌面操作系统环境中完成 GUI 交互任务的能力,包括文件操作、浏览器导航、办公软件使用等,衡量 Agent 作为计算机助手的实用性。
排行
数据源
#
模型
得分
1
MiniMax M3
MiniMax
74.5
%
2
Claude Opus 4.8
Anthropic
72.1
%
3
Claude Opus 4.7
Anthropic
71.6
%
4
Claude Opus 4.6
Anthropic
70.8
%
5
混元3
腾讯
68.5
%
6
Claude Sonnet 4.6
Anthropic
68.3
%
7
GPT-5.5
OpenAI
67.8
%
8
Qwen3.7-Max
阿里巴巴
65.2
%
9
GLM-5.1
智谱AI
62.7
%
10
GLM-5.2
智谱AI
62.4
%
共 21 个模型
1
2
3