跳到主内容
知行录
leaderboard.cn
Toggle Sidebar
搜索模型或厂商…
⌘K
分析
前沿模型
历史趋势
本地模型
模型对比
榜单工坊
资料库
模型库
模型价格
厂商
基准评测
数据源
设置
Toggle Sidebar
知行录
leaderboard.cn
正在加载页面内容
反馈
基准详情正在加载
返回基准目录
BFCL v3 Full
Agent
分享
官方网站
函数调用基准 v3
伯克利函数调用排行榜 v3 (BFCL-v3),评估 LLM 准确调用函数/工具的能力。引入多轮交互场景,涵盖真实世界函数调用数据。使用 AST 作为评估指标,支持原生函数调用和提示驱动两种模式,是衡量 Agent 工具使用能力的核心基准。
排行
数据源
#
模型
得分
1
GLM-4.5
智谱AI
77.8
%
2
GLM-4.5-Air
智谱AI
76.4
%
3
Claude Sonnet 4
Anthropic
73.3
%
4
GPT-4o
OpenAI
72.5
%
5
Qwen3-30B-A3B-Thinking-2507
阿里巴巴
72.4
%
6
Qwen3-235B-A22B-Thinking-2507
阿里巴巴
71.9
%
7
Qwen3-4B-Thinking-2507
阿里巴巴
71.2
%
8
Qwen3-235B-A22B-Instruct-2507
阿里巴巴
70.9
%
9
Qwen3-235B-A22B
阿里巴巴
70.8
%
10
Qwen3-14B
阿里巴巴
70.4
%
共 49 个模型
1
2
3
4
5