跳到主内容
知行录
leaderboard.cn
Toggle Sidebar
搜索模型或厂商…
⌘K
分析
前沿模型
历史趋势
本地模型
模型对比
榜单工坊
资料库
模型库
模型价格
厂商
基准评测
数据源
设置
Toggle Sidebar
知行录
leaderboard.cn
正在加载页面内容
反馈
基准详情正在加载
返回基准目录
PostTrainBench
编程
分享
官方网站
PostTrainBench 评估, 1M 上下文, max effort, 128K 输出 tokens
PostTrainBench 评估模型在后训练阶段(指令微调、RLHF 等)之后的编程能力提升幅度。通过对比基座模型与训练后模型在各类编程任务上的表现差异,量化后训练算法对编程能力的实际增益效果与影响。
排行
数据源
#
模型
得分
1
Claude Opus 4.7
Anthropic
42.4
%
2
Claude Fable 5
Anthropic
41.8
%
3
GLM-5.3
智谱AI
39.8
%
4
GPT-5.5
OpenAI
39.3
%
5
Claude Opus 4.8
Anthropic
37.2
%
6
MiniMax M3
MiniMax
37.1
%
7
Kimi K3
月之暗面
36.6
%
8
GPT-5.6 Sol
OpenAI
36.2
%
9
GLM-5.2
智谱AI
34.3
%
10
Gemini 3.1 Pro
Google
21.6
%
共 12 个模型
1
2