跳到主内容
知行录
leaderboard.cn
Toggle Sidebar
搜索模型或厂商…
⌘K
分析
前沿模型
历史趋势
本地模型
模型对比
榜单工坊
资料库
模型库
模型价格
厂商
基准评测
数据源
设置
Toggle Sidebar
知行录
leaderboard.cn
正在加载页面内容
反馈
基准详情正在加载
返回基准目录
Factual error rate on difficult prompts
推理
分享
官方网站
Share of answers with any factual error on de-identified conversations flagged by users. These difficult prompts are not representative of typical usage.
排行
数据源
#
模型
得分
1
GPT-6 Astra
OpenAI · high
3.9
%
2
GPT-6.1 Sol
OpenAI · xhigh
4.1
%
3
GPT-6 Sol
OpenAI · xhigh
4.5
%
共 3 个模型