Claude Opus 5.5 官方发布评测厂商报告
2026-09-22收录 Anthropic 2026-09-22 发布页主表及 System Card 第 174 页能力汇总表,并补充第 175 页 DeepSWE、第 200 页 Chartography 无工具成绩;合并重复项后共 18 项指标、66 条有效成绩,空缺不生成分数。Opus 5.5 默认采用 adaptive thinking / max,Terminal-Bench 4.0 采用 xhigh;同项 GPT-6 Astra 为 high。OSWorld 2.0 使用 2026-09-10 任务与服务端上下文压缩,partial / strict 分开收录,不与旧版本合并。AutomationBench 为 Zapier 私有留出集,安全拦截计失败且不回退;其余 Opus 5.5 评测按官方说明启用生产安全措施及回退。FrontierCode 主值保留 max 的 54.4,medium 的 54.6 仅作补充。对比模型成绩保留本次厂商来源,不替换历史报告。