跳到主内容
知行录
leaderboard.cn
Toggle Sidebar
搜索模型或厂商…
⌘K
分析
前沿模型
历史趋势
本地模型
模型对比
榜单工坊
资料库
模型库
模型价格
厂商
基准评测
数据源
设置
Toggle Sidebar
知行录
leaderboard.cn
正在加载页面内容
反馈
基准详情正在加载
返回基准目录
Chinese-SimpleQA
知识
分享
官方网站
Chinese SimpleQA 是 OpenAI SimpleQA 的中文版本,包含大量中文事实性问题,覆盖历史、地理、科学、文化等领域。采用生成式评测,通过 LLM-as-Judge 判断答案正确性。测试模型的中文事实性知识准确性和幻觉率。
排行
数据源
#
模型
得分
1
Gemini 3.1 Pro
Google
85.9
%
2
DeepSeek-V4-Pro
深度求索
84.4
%
3
Qwen3-235B-A22B-Instruct-2507
阿里巴巴
84.3
%
4
GPT-5.4
OpenAI
76.8
%
5
Claude Opus 4.6
Anthropic
76.4
%
6
Kimi-K2.6
月之暗面
75.9
%
7
GLM-5.1
智谱AI
75.0
%
8
DeepSeek-V3
深度求索
68.0
%
9
DeepSeek-R1
深度求索
63.7
%
10
GPT-4o
OpenAI
59.3
%
共 16 个模型
1
2