Claude Opus 5.5 全面解读:更便宜的 Opus,逼近 Fable 的能力

3次阅读
没有评论

共计 4917 个字符,预计需要花费 13 分钟才能阅读完成。

2026 年 9 月 22 日,[[Anthropic]] 发布了 [[Claude]] Opus 5.5,这是 Claude 5.5 家族的第一个模型,Sonnet 5.5 和 Haiku 5.5 会在接下来几周陆续跟上。这也是 Dario Amodei 发表那篇 "pacing the frontier" 文章之后 Anthropic 的第一次模型发布,发布前 METR^1 和 Frontier Design1 都参与了测试。

Opus 5.5 在绝大多数工作上和 Claude Fable 5.1 表现相当,但价格是 Opus 级别,而且典型负载下比 Opus 5 便宜约 40%。Opus 4.6 主打的是上下文和能力上限,而 5.5 主打的是"同样的能力,更低的成本、更快的速度"。

定位:Fable 级能力,Opus 级价格

在 Claude 5 时代,Anthropic 的产品线顶端是 Fable 5.1,Opus 5 则是日常主力。Opus 5.5 的出现某种程度上模糊了这条界线。官方的说法是它在大多数工作上"about as well as Claude Fable 5.1",并且特别指出,基准分数上的差距正在变成一个越来越不可靠的参考,在 Anthropic 内部的实际使用中,Opus 5.5 与 Fable 5.1 之间的差距比跑分显示的还要小。

这意味着对于很多原本需要 Fable 才能完成的任务,现在可以用 Opus 5.5 来替代,而这背后是实打实的成本差异。

定价与速度

先看价格,这是这次更新最直接的变化:

每百万 token Opus 5.5 Opus 5
输入 $4 $5
输出 $20 $25
缓存读取 $0.20 $0.50
缓存写入 $5 $6.25

输入和输出单价都下降了 20%,缓存读取更是便宜了 60%,对于大量使用 [[Prompt Caching]] 的 Agent 类应用来说,这一项的影响可能比单价更大。

更重要的是 Opus 5.5 完成同一任务所需的 token 更少。单价下降加上 token 效率提升,官方给出的综合结果是典型工作负载的成本下降约 40%。

速度方面,标准模式下的输出速度比 Opus 5 快 30% 以上。另外在 [[Claude Code]] 和 Claude Platform 上还提供了 Fast mode,速度最高可达 2.5 倍,价格为输入 $8、输出 $40 每百万 token,适合对延迟敏感的交互场景。

订阅用户也有好消息:Pro、Max、Team 以及按席位计费的 Enterprise 计划,5 小时用量上限都会提高,并且会额外获得一次可以保存下来、稍后再用的限额重置。

基准测试

下面是官方公布的主要基准测试结果,对比对象包括 Fable 5.1、Opus 5,以及 [[OpenAI]] 的 GPT-6 Astra 和 GPT-5.6 Sol:

基准 Opus 5.5 Fable 5.1 Opus 5 GPT-6 Astra GPT-5.6 Sol
Terminal-Bench 4.0 66.4% 55.8% 52.3% 57.9% 37.3%
FrontierCode v1.1 54.4% 50.3% 48.0% 53.3% 47.5%
CursorBench 4.0 57.8% 51.8% 46.6% 41.7%
GDPval-AA v2.1 (Elo) 1846 1735 1708 1542 1588
AutomationBench 40.0% 31.4% 26.9% 41.4% 28.8%
Humanity’s Last Exam(带工具) 67.7% 65.6% 63.6% 57.2%
Terminal-Bench-Science 0.1 58.7% 52.6% 29.0% 64.6% 22.4%

另外在 OSWorld 2.0 上 Opus 5.5、Fable 5.1、Opus 5 分别为 81.8%、80.7%、74.0%,Chartography(带工具)上分别为 89.0%、88.4%、83.4%。

从这张表能看出几点:

  • 编程相关的基准(Terminal-Bench、FrontierCode、CursorBench)上,Opus 5.5 不仅超过了自家的 Fable 5.1,也领先 GPT-6 Astra。Terminal-Bench 4.0 上 66.4% 对比 Opus 5 的 52.3%,提升幅度相当大
  • GDPval 衡量的是真实经济价值任务,1846 的 Elo 比 Opus 5 高出 138 分,比 GPT-6 Astra 高出 300 多分
  • 并不是全面领先,AutomationBench 和 Terminal-Bench-Science 上 GPT-6 Astra 仍然更好

有一个细节值得注意:这些测试默认是在自适应思考、max effort、并且开启生产环境安全防护的条件下跑的。当安全防护介入时,任务会交给后备模型完成,网络安全类任务用 Opus 4.8,生物和前沿 LLM 开发类任务用 Opus 5。Anthropic 也承认这很可能拉低了 Opus 5.5 的分数。AutomationBench 由 Zapier 运行,防护介入直接记为失败2

性价比才是真正的亮点

单看跑分并不能完全体现 Opus 5.5 的价值,官方给出的成本对比更有说服力:

  • FrontierCode 上,Opus 5.5 在默认的 medium effort 下就能超过 GPT-6 Astra 的最好成绩,每个任务成本只有对方的约五分之一。有意思的是,medium effort 的得分(54.6%)甚至略高于 max effort 的 54.4%
  • Terminal-Bench 上,以约 40% 的成本追平 Astra;默认 effort 下就能击败 max effort 的 Opus 5,成本约为五分之一
  • CursorBench 上,比 GPT-5.6 Sol 高 11 分,成本约三分之一
  • GDPval 上,medium effort 的 Opus 5.5 击败 max effort 的 Astra,成本约五分之一

这对实际使用的启发是:不必一上来就把 effort 拉满。对于大部分编程和知识工作,medium effort 已经够用,而且省下的成本非常可观。[[Factory]] 的评价也印证了这一点,他们说这是"第一个我们会默认用 medium effort 的模型"3

真实任务中的表现

比起基准测试,我更关心它在真实任务中能做什么。官方和早期测试者给出了不少例子:

编程方面,一位测试者用不到一天完成了 68 万行代码的迁移;在优化一个 Web 应用页面加载时间的任务中,40 次尝试里成功了 39 次,而 Opus 5 的优化幅度更小,还改变了应用原有的行为4;审计并修复一个 20 万行的代码库,Opus 5.5 用了不到 3 小时,Opus 5 则超过 20 小时,并消耗了 2.5 倍的 token5

还有一个很有代表性的例子:把 [[HAProxy]] 从 C 移植到 Rust,Opus 5.5 用了 9.5 小时,Fable 5.1 用了 12 小时,而 Opus 5.5 的成本低了 51%5

知识工作方面,在一项财报研究测试中,Opus 5.5 生成的 18 份报告里有 16 份达到了 Anthropic 的质量标准,而 Fable 5.1 和 Opus 5 一份都没有通过6。一个并购分析任务(包括 Excel 模型和演示文稿)用时 63 分钟,Opus 5 需要 93 分钟,成本也只有一半6

写作方面,Opus 5.5 的文字更清晰,会先把重点讲出来,行话更少,也更能遵守给定的写作风格规则3。对于经常让 AI 帮忙起草文档的人来说,这一点在日常体验中会很明显。

客户反馈

几家早期接入的公司给出的数据也很有参考价值:

  • [[GitHub]]:比 Opus 5 解决了更多终端任务,所用步骤不到一半[^6]
  • Clio:能够持续专注在一个任务上超过 18 小时[^6]
  • Quantium:以前需要 4 天、38 条 prompt 的任务,现在 3 小时、11 条 prompt 就能完成[^6]
  • Optiver:相关工作负载的成本降低了 40% 到 50%[^6]
  • Deloitte:在已知 bug 中找出了 72%,而 high effort 的 Opus 5 是 56%[^7]
  • Hebbia:覆盖了他们关注要点的 86.6%,Opus 5 为 60.3%[^7]
  • [[Box]]:token 用量只有 Opus 5 的三分之一[^4]

这些反馈集中指向两个方向,一是长时间自主运行的稳定性,二是 token 效率。这两点恰恰是 Agent 类应用最在意的。

安全与对齐

Anthropic 在安全方面也给出了不少数据:

  • 在覆盖近 2000 个场景的自动化行为审计中,Opus 5.5 取得了迄今所有模型中最好的成绩,在大多数诚实性指标上也是最强的[^8]
  • 试图越过隔离边界的行为比 Opus 5 和 Mythos 5.1 少约 85%,而且所有尝试都是低严重度,并且是模型自己主动报告的[^8]
  • 对 prompt injection 的抵抗能力比 Opus 5 更强,在 Gray Swan 的测试中与 Fable 5.1 并列攻击成功率最低[^6]

官方也坦率地指出了一个隐忧:模型经常会怀疑自己正在被评估,这让判断它在真实环境中的行为变得更困难。

防护机制与 Fable 5.1 基本一致:

  • 大多数网络安全相关任务会被路由到 Opus 4.8 处理
  • 生物领域的防护与 Fable 5.1 相同
  • 经过审核的机构可以申请 Life Sciences Verification Program,Cyber Verification Program 也在扩展,分为三个等级
  • 每个操作在执行前都会经过一个动作筛查分类器,同时提供一个开源沙箱,方便安全团队审计

还有几个开发者需要留意的细节:

  • Preserved thinking 机制用于防止模型蒸馏,适用于 2026 年 8 月 31 日及之后创建的 API 账户
  • 思考(thinking)无法关闭
  • 支持零数据保留(Zero Data Retention)
  • 内置符合欧盟 AI 法案要求的水印

如何使用

Opus 5.5 已经在所有平台上线,包括 Claude.ai、Claude Code、Claude API,以及 [[AWS]] Bedrock、[[Google Cloud]] Vertex AI 和 [[Microsoft Azure]]。API 中的模型 ID 是 claude-opus-5-5

在 Claude Code 中可以直接用 /model 切换,需要更快响应的时候用 /fast 打开 Fast mode。通过 API 调用的话,一个最简单的例子:

curl https://api.anthropic.com/v1/messages \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -H "content-type: application/json" \
  -d '{
    "model": "claude-opus-5-5",
    "max_tokens": 4096,
    "messages": [{"role": "user", "content": "Hello, Opus 5.5"}]
  }'

我的看法

Opus 5.5 改变了模型选择的逻辑,以前的思路通常是"越重要的任务用越贵的模型",而 Opus 5.5 在大量任务上用 medium effort 就能打平甚至超过其他模型的 max effort,这让"够用就好"变成了一个真正可行的策略。

对于日常开发,我的建议是:

  • 把 Opus 5.5 作为 Claude Code 的默认模型,effort 先用 medium,遇到确实困难的问题再调高
  • 长时间运行的 Agent 任务、大规模代码迁移和审计,是 Opus 5.5 相对 Opus 5 提升最明显的场景,值得优先切换
  • 大量使用 prompt caching 的应用,缓存读取降价 60% 带来的收益可能比单价下降更显著
  • 如果工作涉及网络安全,需要注意相关任务会被路由到 Opus 4.8,效果可能不如预期,可以考虑申请 Cyber Verification Program

接下来 Sonnet 5.5 和 Haiku 5.5 也会陆续发布,届时整条产品线的性价比格局可能还会再变一次。

参考

正文完
 0
评论(没有评论)