跳到主内容
知行录
leaderboard.cn
Toggle Sidebar
搜索模型或厂商…
⌘K
分析
前沿模型
历史趋势
本地模型
模型对比
榜单工坊
资料库
模型库
模型价格
厂商
基准评测
数据源
设置
Toggle Sidebar
知行录
leaderboard.cn
正在加载页面内容
反馈
基准详情正在加载
返回基准目录
CoWorkBench
Agent
分享
CoWorkBench 评估 AI Agent 在多人协作工作场景中的能力。测试 Agent 能否理解团队上下文、协调多角色任务、追踪跨成员依赖关系以及维护共享工作成果,聚焦于企业环境中 Agent 作为团队一员的有效性和协作智能。
排行
数据源
#
模型
得分
1
Claude Fable 5
Anthropic
75.9
%
2
Qwen3.8-2.4T-A95B
阿里巴巴
74.8
%
3
Qwen3.8-Max
阿里巴巴
74.8
%
4
Qwen3.8-Flash-Next
阿里巴巴
73.9
%
5
Claude Opus 4.8
Anthropic
72.3
%
6
GPT-5.6 Sol
OpenAI
71.5
%
7
Qwen3.8-27B
阿里巴巴
70.7
%
8
Claude Opus 4.6
Anthropic
68.2
%
9
Qwen3.7-Max
阿里巴巴
67.2
%
10
DeepSeek-V4-Pro
深度求索
66.3
%
共 16 个模型
1
2