跳到主内容
知行录
leaderboard.cn
Toggle Sidebar
搜索模型或厂商…
⌘K
分析
前沿模型
历史趋势
本地模型
模型对比
榜单工坊
资料库
模型库
模型价格
厂商
基准评测
数据源
设置
Toggle Sidebar
知行录
leaderboard.cn
正在加载页面内容
反馈
基准详情正在加载
返回基准目录
Vending Bench 2
Agent
分享
电商/交易场景 Agent 基准, 得分单位为美元 (收入)
Vending Bench 2 评估 AI Agent 在模拟自助售货机交互场景中的决策和操作能力。Agent 需要理解商品信息、处理支付、管理库存和处理故障,测试 Agent 在受限交互界面下的实用性和自主性。
排行
数据源
#
模型
得分
1
Claude Opus 4.6
Anthropic
8,017.6
$
2
GPT-5.4
OpenAI
6,144.2
$
3
GLM-5.1
智谱AI
5,634.4
$
4
Gemini 3 Pro
Google
5,478.2
$
5
Qwen3.6-Plus
阿里巴巴
5,114.9
$
6
Claude Opus 4.5
Anthropic
4,967.1
$
7
GLM-5
智谱AI
4,432.1
$
8
GPT-5.2
OpenAI
3,591.3
$
9
GLM-4.7
智谱AI
2,376.8
$
10
Kimi-K2.5
月之暗面
1,198.5
$
共 12 个模型
1
2