Anthropic 发布 Opus 5.5:编程能力超越 Fable,输出价格下调

科技/AI
Anthropic 发布 Claude 旗舰模型 Opus 5.5,公司称其在编程和知识工作上刷新最好成绩,多项基准超过体量更大的 Fable,输出价格从每百万 token 25 美元降至 20 美元,运行速度同步提升。新模型更少使用行话,倾向把重点放在回答开头。Sonnet 5.5 和 Haiku 5.5 将在未来几周推出,Opus 5.5 的安全护栏与 Fable 一致。
Anthropic 发布 Opus 5.5:编程能力超越 Fable,输出价格下调

Anthropic 于周二发布最新旗舰模型 Opus 5.5。公司称,新模型在编程与知识工作任务上刷新了当前最好成绩,同时把输出价格从上一代的每百万 token 25 美元降到 20 美元。

在 Claude 的三档产品线里,Opus 能力最强、价格最高,Sonnet 居中,Haiku 主打速度和低价。这次更新的关键,是把顶级档位的性能与更低的使用成本绑在了一起。

Anthropic 表示,Opus 5.5 在多项基准测试中超过体量更大的 Fable 模型,还完成了若干 Fable 没能跑通的非正式任务。一家把前沿模型当作核心产品的公司,会格外在意这类结果对推理算力开销的影响。

除输出单价下调外,其他计费指标也有相近幅度的下降,运行速度则有所提升,原因是服务该模型所需的算力整体减少。

按 token 计费的 API 用户会同时感受到价格与延迟的变化,同样的预算能跑更多任务。编程助手、代码审查、长文档处理都是 token 消耗的大户,价格每降一档,都会影响企业愿不愿意把模型放进生产流程。

旗舰档位降价,等于向企业客户释放一个信号:前沿能力不再是只有预算充裕才能长期使用的选项。

新版本还调整了模型的沟通方式,更少使用行话,更倾向于把重要信息放在回答开头。开发者每天要看大量模型输出,这类改动对实际体验的影响,往往比基准分数更直接。

上一代 Opus 5 于 7 月 24 日发布,到这次更新相隔两个月。Anthropic 透露,产品线另外两档 Sonnet 5.5 和 Haiku 5.5 将在未来几周内推出,性能提升幅度相近。

Anthropic 称,Opus 5.5 在生物学和网络安全方面的能力与 Mythos 相当,因此适用与 Fable 相同的安全措施。这些限制约束模型被用于在编译程序里寻找漏洞、开发可识别的生物武器等用途。

这也是 CEO Dario Amodei 公开支持为前沿能力设定节奏之后,公司发布的第一款模型。他本月初在一篇文章中写道,完整应对风险需要更加审慎,除了投入风险预防,还要让能力推进的速度与风险防控的时间相匹配。

Opus 5.5 的安全训练与上一代大体相似,包括对齐测试,以及 METR、Frontier Design 等外部机构在发布前所做的评估。Anthropic 强调,面向未来模型的更先进训练与评估体系已在准备,涉及改进后的安全与监控系统。

Anthropic 在博客文章中表示,AI 能力越强,公共政策在保障人们所依赖系统的安全上就应承担更大作用;这种能力的建设需要时间,相关基础设施已开始搭建,公司称不久后会公布更多细节。

把时间线拉开,这次更新夹在两股力量之间:一边是同行围绕编程与 agent 能力的密集迭代,另一边是公司自己提出的放慢前沿节奏。

旗舰模型两个月一更、价格继续下探,说明市场竞争的惯性仍然强于节制能力的表态。

Fable 与 Mythos 这类更大型号的存在,也让 Anthropic 的产品分层更清楚:用不同规模的模型覆盖不同风险等级和成本区间,把限制加在能力最强的一档上。

Opus 5.5 被拿来与 Mythos 比较生物和网络安全能力,正是能力分档与安全分档被一并处理的体现。

开发者真正需要盯住的是两条线:同等任务的成本曲线,以及安全限制划出的可用边界。价格下降扩大的是前一条线能触达的范围,护栏决定的则是哪些事根本不能做。

旗舰模型的更新周期被压缩到两个月,调用价格还在往下走,这轮竞争的胜负短期内不会由某个基准分数决定,而取决于谁能把强能力稳定、便宜地交付到生产环境里。