跳到主内容
知行录
leaderboard.cn
Toggle Sidebar
搜索模型或厂商…
⌘K
分析
前沿模型
历史趋势
本地模型
模型对比
榜单工坊
资料库
模型库
模型价格
厂商
基准评测
数据源
设置
Toggle Sidebar
知行录
leaderboard.cn
正在加载页面内容
反馈
基准详情正在加载
返回基准目录
LongBench v2
长上下文
分享
官方网站
LongBench v2 是长文本理解评测基准的第二版,由 THUDM 提出。包含单文档问答、多文档摘要、长文本分类等多种长上下文任务,文本长度从几千到数万 token。v2 增加了更多需要长距离依赖建模的复杂推理题。
排行
数据源
#
模型
得分
1
Claude Opus 4.8
Anthropic
69.1
%
2
Qwen3.5-397B-A17B
阿里巴巴
68.9
%
3
GPT-5.6 Sol
OpenAI
67.1
%
4
Qwen3.8-2.4T-A95B
阿里巴巴
66.3
%
5
Qwen3.8-Max
阿里巴巴
66.3
%
6
Qwen3.7-Max
阿里巴巴
65.3
%
7
Claude Opus 4.5
Anthropic
64.4
%
8
DeepSeek-V4-Pro
深度求索
62.1
%
9
Qwen3.6-Plus
阿里巴巴
62.0
%
10
Nemotron-3-Ultra
NVIDIA
61.9
%
共 27 个模型
1
2
3