Meta Muse Spark 1.2 Evaluation Report厂商报告
2026-08-05来源于 Meta 官方发布公告的 5 项评测图:Terminal-Bench 2.1 与 DeepSWE 1.1 为 Meta 自测(官方 89 / 113 任务全集,每个模型使用其选择的 agent 产品与最高可用推理强度,Muse Code 用于 Muse Spark 1.2,5 次尝试 pass@1 平均);GDPVal-AA v2 采用 Artificial Analysis 结果;MCP Atlas 采用 Scale AI 结果;Meta Internal Coding Bench 为 Meta 内部基准(440 任务,外部不可复现)。数值取自官方图表标签。方法说明: https://research.meta.ai/static/muse-spark-1-2-methodology