跳到主内容
知行录
leaderboard.cn
Toggle Sidebar
搜索模型或厂商…
⌘K
分析
前沿模型
历史趋势
本地模型
模型对比
榜单工坊
资料库
模型库
模型价格
厂商
基准评测
数据源
设置
Toggle Sidebar
知行录
leaderboard.cn
正在加载页面内容
反馈
基准详情正在加载
返回基准目录
AutomationBench
Agent
分享
官方网站
AutomationBench 评估 AI Agent 通过 REST API 协调 CRM、邮箱、日历等多系统完成真实业务流程的能力。任务涵盖销售、市场、运营、客服、财务和 HR 六大领域,Agent 需自主发现 API 端点并遵循业务策略。
排行
数据源
#
模型
得分
1
DeepSeek-V4.1-Flash
深度求索
54.8
%
2
Gemini 3.7 Flash
Google
52.3
%
3
Qwen3.8-Max
阿里巴巴 · 0902
50.8
%
4
Claude Opus 5
Anthropic
50.3
%
5
Muse Spark 1.3
Meta · max 模式
49.4
%
6
GLM-5.3-Flash
智谱AI
48.8
%
7
GLM-5.3
智谱AI
48.2
%
8
GPT-5.6 Sol
OpenAI · max 模式
46.7
%
9
Kimi K3
月之暗面
46.7
%
10
Claude Fable 5
Anthropic
46.2
%
共 27 个模型
1
2
3