DeepSeek-V4.1-Flash 技术报告厂商报告
2026-09-10来源于 DeepSeek-V4.1-Flash 技术报告第 33 页 Table 3。收录主模型的 19 行基准,HLE 完整集与纯文本子集拆分后共 20 项成绩;另收录同表 ZeroBench-main 带工具 Pass@5 的 3 个对照值,共 23 条成绩。Base 模型与其他模型的其余成绩不在本次范围内。以技术报告为准:Codeforces 为 3471(发布图为 3921),NL2Repo 为 65.4(模型卡为 64.0),CyberGym 为 88.1(发布图为空)。评测采用 max 推理强度;推理任务 top_p=1.0,Agent 任务 top_p=0.95,temperature=1.0。DeepSWE v1.1 使用 mini-SWE,其余代码任务使用 DeepSeek Harness 极简模式;视觉 Agent 使用 Claude Code。AutomationBench 为 v1.0.6 公开评测集。原始指标、评测配置与来源差异保存在 raw。