跳到主内容
知行录
leaderboard.cn
Toggle Sidebar
搜索模型或厂商…
⌘K
分析
前沿模型
历史趋势
本地模型
模型对比
榜单工坊
资料库
模型库
模型价格
厂商
基准评测
数据源
设置
Toggle Sidebar
知行录
leaderboard.cn
正在加载页面内容
反馈
基准详情正在加载
返回基准目录
ProgramBench
编程
分享
官方网站
200 实例, Claude-Code 2.1.156, reasoning_effort=max, 400K 上下文
ProgramBench 评估代码生成 Agent 是否能仅根据已编译二进制和文档复刻程序行为。它包含 200 个任务,从小型 CLI 工具到 FFmpeg、SQLite 等大型系统;提交结果通过 248000+ 个 fuzz 生成的行为测试,与原始二进制输出进行对比。任务不给源码、反编译结果或互联网访问,要求 Agent 自行选择语言并从零实现完整程序。
排行
数据源
#
模型
得分
1
Kimi K3
月之暗面
77.8
%
2
GPT-5.6 Sol
OpenAI
77.6
%
3
Claude Fable 5
Anthropic
76.8
%
4
Claude Opus 4.8
Anthropic
71.9
%
5
GPT-5.5
OpenAI
70.8
%
6
GLM-5.2
智谱AI
63.7
%
7
Kimi-K2.7-Code
月之暗面
53.6
%
8
Claude Opus 4.7
Anthropic
52.1
%
9
GLM-5.1
智谱AI
50.9
%
10
Seed2.1 Pro
字节跳动
50.3
%
共 14 个模型
1
2