Claude Opus 5 发布:接近旗舰性能,价格不变

Anthropic 今天正式发布 Claude Opus 5,定位为「日常可用」的顶级模型,定价与上一代 Opus 4.8 保持一致(输入 $5/百万 token,输出 $25/百万 token),但性能大幅提升,在多项基准上接近旗舰模型 Fable 5 的水平,成本仅为其一半。

在软件工程能力上,Opus 5 在 Frontier-Bench v0.1 上超越所有现有模型,以低于 Opus 4.8 的单任务成本实现 超过两倍 的得分。在 CursorBench 3.2 最高 effort 设置下,Opus 5 的峰值分数与 Fable 5 相差不到 0.5%,但每任务成本减半。知识工作方面同样亮眼:ARC-AGI 3 得分为次优模型的 3 倍Zapier AutomationBench 在相同成本下通过率约为其他最佳模型的 1.5 倍;在 OSWorld 2.0 计算机使用评测中,任何给定成本下 Opus 5 均超越所有模型,以 不到 Fable 5 三分之一 的成本达到其最好成绩。

科学研究能力提升显著。在生命科学评测上,Opus 5 在所有项目上均优于 Opus 4.8,尤其是有机化学(从光谱数据推断分子结构,内部基准得分高出 10.2 个百分点)和蛋白质相关任务(预测序列变异影响,得分高 7.7 个百分点)。它还具备更强的视觉输出能力。

Opus 5 的「判断力」和「严谨性」是早期客户反馈中最突出的特点。多个用户报告提到,模型会主动验证自己的工作、发现代码中社区补丁遗漏的边界情况、自行构建测试框架。例如在 Frontier-Bench 一个任务中,它被故意切断直接查看图纸的途径后,自己编写计算机视觉管线从原始像素提取几何信息并重建 3D 模型,而其他模型在五次尝试中均未成功。在 Zapier AutomationBench 上,处理原始账户健康工作簿的流失预防任务,Opus 5 实现 100% 通过率。金融建模评测中,Opus 5 在各 effort 级别平均准确率高 9 个百分点,同时减少 三分之一的轮次和工具调用 以及 60% 的时间。法律领域,在保持质量的同时平均生成 token 数比 Opus 4.8 最大推理时少 26%

对齐与安全方面,Anthropic 的自动化行为审计显示 Opus 5 是其截至目前 对齐性最佳的模型,整体不当行为得分仅 2.3(越低越好),低于 Opus 4.8、Sonnet 5 和 Fable 5。它表现出最低的欺骗倾向和最难被诱导误用。在风险能力上,Opus 5 并未推进双重用途能力的边界:在生物学研究和进攻性网络安全方面依然落后于 Mythos 5。网络分类器比 Fable 5 宽松约 85%,允许查找源代码漏洞但阻止基于二进制的扫描、渗透测试和漏洞利用生成。被拦截的请求默认回退到 Opus 4.8。

目前 Opus 5 已在所有平台上线,API 中可用,同时支持 Fast mode(约 2.5 倍 默认速度,价格翻倍)。本次发布还包含两项 beta 功能:对话中动态更换工具(不使提示缓存失效)、API 自动回退(被安全分类器拦截的请求自动路由到其他模型)。

Introducing Claude Opus 5

查看原文