共计 4917 个字符,预计需要花费 13 分钟才能阅读完成。
2026 年 9 月 22 日,[[Anthropic]] 发布了 [[Claude]] Opus 5.5,这是 Claude 5.5 家族的第一个模型,Sonnet 5.5 和 Haiku 5.5 会在接下来几周陆续跟上。这也是 Dario Amodei 发表那篇 "pacing the frontier" 文章之后 Anthropic 的第一次模型发布,发布前 METR^1 和 Frontier Design1 都参与了测试。
Opus 5.5 在绝大多数工作上和 Claude Fable 5.1 表现相当,但价格是 Opus 级别,而且典型负载下比 Opus 5 便宜约 40%。Opus 4.6 主打的是上下文和能力上限,而 5.5 主打的是"同样的能力,更低的成本、更快的速度"。
定位:Fable 级能力,Opus 级价格
在 Claude 5 时代,Anthropic 的产品线顶端是 Fable 5.1,Opus 5 则是日常主力。Opus 5.5 的出现某种程度上模糊了这条界线。官方的说法是它在大多数工作上"about as well as Claude Fable 5.1",并且特别指出,基准分数上的差距正在变成一个越来越不可靠的参考,在 Anthropic 内部的实际使用中,Opus 5.5 与 Fable 5.1 之间的差距比跑分显示的还要小。
这意味着对于很多原本需要 Fable 才能完成的任务,现在可以用 Opus 5.5 来替代,而这背后是实打实的成本差异。
定价与速度
先看价格,这是这次更新最直接的变化:
| 每百万 token | Opus 5.5 | Opus 5 |
|---|---|---|
| 输入 | $4 | $5 |
| 输出 | $20 | $25 |
| 缓存读取 | $0.20 | $0.50 |
| 缓存写入 | $5 | $6.25 |
输入和输出单价都下降了 20%,缓存读取更是便宜了 60%,对于大量使用 [[Prompt Caching]] 的 Agent 类应用来说,这一项的影响可能比单价更大。
更重要的是 Opus 5.5 完成同一任务所需的 token 更少。单价下降加上 token 效率提升,官方给出的综合结果是典型工作负载的成本下降约 40%。
速度方面,标准模式下的输出速度比 Opus 5 快 30% 以上。另外在 [[Claude Code]] 和 Claude Platform 上还提供了 Fast mode,速度最高可达 2.5 倍,价格为输入 $8、输出 $40 每百万 token,适合对延迟敏感的交互场景。
订阅用户也有好消息:Pro、Max、Team 以及按席位计费的 Enterprise 计划,5 小时用量上限都会提高,并且会额外获得一次可以保存下来、稍后再用的限额重置。
基准测试
下面是官方公布的主要基准测试结果,对比对象包括 Fable 5.1、Opus 5,以及 [[OpenAI]] 的 GPT-6 Astra 和 GPT-5.6 Sol:
| 基准 | Opus 5.5 | Fable 5.1 | Opus 5 | GPT-6 Astra | GPT-5.6 Sol |
|---|---|---|---|---|---|
| Terminal-Bench 4.0 | 66.4% | 55.8% | 52.3% | 57.9% | 37.3% |
| FrontierCode v1.1 | 54.4% | 50.3% | 48.0% | 53.3% | 47.5% |
| CursorBench 4.0 | 57.8% | 51.8% | 46.6% | — | 41.7% |
| GDPval-AA v2.1 (Elo) | 1846 | 1735 | 1708 | 1542 | 1588 |
| AutomationBench | 40.0% | 31.4% | 26.9% | 41.4% | 28.8% |
| Humanity’s Last Exam(带工具) | 67.7% | 65.6% | 63.6% | 57.2% | — |
| Terminal-Bench-Science 0.1 | 58.7% | 52.6% | 29.0% | 64.6% | 22.4% |
另外在 OSWorld 2.0 上 Opus 5.5、Fable 5.1、Opus 5 分别为 81.8%、80.7%、74.0%,Chartography(带工具)上分别为 89.0%、88.4%、83.4%。
从这张表能看出几点:
- 编程相关的基准(Terminal-Bench、FrontierCode、CursorBench)上,Opus 5.5 不仅超过了自家的 Fable 5.1,也领先 GPT-6 Astra。Terminal-Bench 4.0 上 66.4% 对比 Opus 5 的 52.3%,提升幅度相当大
- GDPval 衡量的是真实经济价值任务,1846 的 Elo 比 Opus 5 高出 138 分,比 GPT-6 Astra 高出 300 多分
- 并不是全面领先,AutomationBench 和 Terminal-Bench-Science 上 GPT-6 Astra 仍然更好
有一个细节值得注意:这些测试默认是在自适应思考、max effort、并且开启生产环境安全防护的条件下跑的。当安全防护介入时,任务会交给后备模型完成,网络安全类任务用 Opus 4.8,生物和前沿 LLM 开发类任务用 Opus 5。Anthropic 也承认这很可能拉低了 Opus 5.5 的分数。AutomationBench 由 Zapier 运行,防护介入直接记为失败2。
性价比才是真正的亮点
单看跑分并不能完全体现 Opus 5.5 的价值,官方给出的成本对比更有说服力:
- FrontierCode 上,Opus 5.5 在默认的 medium effort 下就能超过 GPT-6 Astra 的最好成绩,每个任务成本只有对方的约五分之一。有意思的是,medium effort 的得分(54.6%)甚至略高于 max effort 的 54.4%
- Terminal-Bench 上,以约 40% 的成本追平 Astra;默认 effort 下就能击败 max effort 的 Opus 5,成本约为五分之一
- CursorBench 上,比 GPT-5.6 Sol 高 11 分,成本约三分之一
- GDPval 上,medium effort 的 Opus 5.5 击败 max effort 的 Astra,成本约五分之一
这对实际使用的启发是:不必一上来就把 effort 拉满。对于大部分编程和知识工作,medium effort 已经够用,而且省下的成本非常可观。[[Factory]] 的评价也印证了这一点,他们说这是"第一个我们会默认用 medium effort 的模型"3。
真实任务中的表现
比起基准测试,我更关心它在真实任务中能做什么。官方和早期测试者给出了不少例子:
编程方面,一位测试者用不到一天完成了 68 万行代码的迁移;在优化一个 Web 应用页面加载时间的任务中,40 次尝试里成功了 39 次,而 Opus 5 的优化幅度更小,还改变了应用原有的行为4;审计并修复一个 20 万行的代码库,Opus 5.5 用了不到 3 小时,Opus 5 则超过 20 小时,并消耗了 2.5 倍的 token5。
还有一个很有代表性的例子:把 [[HAProxy]] 从 C 移植到 Rust,Opus 5.5 用了 9.5 小时,Fable 5.1 用了 12 小时,而 Opus 5.5 的成本低了 51%5。
知识工作方面,在一项财报研究测试中,Opus 5.5 生成的 18 份报告里有 16 份达到了 Anthropic 的质量标准,而 Fable 5.1 和 Opus 5 一份都没有通过6。一个并购分析任务(包括 Excel 模型和演示文稿)用时 63 分钟,Opus 5 需要 93 分钟,成本也只有一半6。
写作方面,Opus 5.5 的文字更清晰,会先把重点讲出来,行话更少,也更能遵守给定的写作风格规则3。对于经常让 AI 帮忙起草文档的人来说,这一点在日常体验中会很明显。
客户反馈
几家早期接入的公司给出的数据也很有参考价值:
- [[GitHub]]:比 Opus 5 解决了更多终端任务,所用步骤不到一半[^6]
- Clio:能够持续专注在一个任务上超过 18 小时[^6]
- Quantium:以前需要 4 天、38 条 prompt 的任务,现在 3 小时、11 条 prompt 就能完成[^6]
- Optiver:相关工作负载的成本降低了 40% 到 50%[^6]
- Deloitte:在已知 bug 中找出了 72%,而 high effort 的 Opus 5 是 56%[^7]
- Hebbia:覆盖了他们关注要点的 86.6%,Opus 5 为 60.3%[^7]
- [[Box]]:token 用量只有 Opus 5 的三分之一[^4]
这些反馈集中指向两个方向,一是长时间自主运行的稳定性,二是 token 效率。这两点恰恰是 Agent 类应用最在意的。
安全与对齐
Anthropic 在安全方面也给出了不少数据:
- 在覆盖近 2000 个场景的自动化行为审计中,Opus 5.5 取得了迄今所有模型中最好的成绩,在大多数诚实性指标上也是最强的[^8]
- 试图越过隔离边界的行为比 Opus 5 和 Mythos 5.1 少约 85%,而且所有尝试都是低严重度,并且是模型自己主动报告的[^8]
- 对 prompt injection 的抵抗能力比 Opus 5 更强,在 Gray Swan 的测试中与 Fable 5.1 并列攻击成功率最低[^6]
官方也坦率地指出了一个隐忧:模型经常会怀疑自己正在被评估,这让判断它在真实环境中的行为变得更困难。
防护机制与 Fable 5.1 基本一致:
- 大多数网络安全相关任务会被路由到 Opus 4.8 处理
- 生物领域的防护与 Fable 5.1 相同
- 经过审核的机构可以申请 Life Sciences Verification Program,Cyber Verification Program 也在扩展,分为三个等级
- 每个操作在执行前都会经过一个动作筛查分类器,同时提供一个开源沙箱,方便安全团队审计
还有几个开发者需要留意的细节:
- Preserved thinking 机制用于防止模型蒸馏,适用于 2026 年 8 月 31 日及之后创建的 API 账户
- 思考(thinking)无法关闭
- 支持零数据保留(Zero Data Retention)
- 内置符合欧盟 AI 法案要求的水印
如何使用
Opus 5.5 已经在所有平台上线,包括 Claude.ai、Claude Code、Claude API,以及 [[AWS]] Bedrock、[[Google Cloud]] Vertex AI 和 [[Microsoft Azure]]。API 中的模型 ID 是 claude-opus-5-5。
在 Claude Code 中可以直接用 /model 切换,需要更快响应的时候用 /fast 打开 Fast mode。通过 API 调用的话,一个最简单的例子:
curl https://api.anthropic.com/v1/messages \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "content-type: application/json" \
-d '{
"model": "claude-opus-5-5",
"max_tokens": 4096,
"messages": [{"role": "user", "content": "Hello, Opus 5.5"}]
}'
我的看法
Opus 5.5 改变了模型选择的逻辑,以前的思路通常是"越重要的任务用越贵的模型",而 Opus 5.5 在大量任务上用 medium effort 就能打平甚至超过其他模型的 max effort,这让"够用就好"变成了一个真正可行的策略。
对于日常开发,我的建议是:
- 把 Opus 5.5 作为 Claude Code 的默认模型,effort 先用 medium,遇到确实困难的问题再调高
- 长时间运行的 Agent 任务、大规模代码迁移和审计,是 Opus 5.5 相对 Opus 5 提升最明显的场景,值得优先切换
- 大量使用 prompt caching 的应用,缓存读取降价 60% 带来的收益可能比单价下降更显著
- 如果工作涉及网络安全,需要注意相关任务会被路由到 Opus 4.8,效果可能不如预期,可以考虑申请 Cyber Verification Program
接下来 Sonnet 5.5 和 Haiku 5.5 也会陆续发布,届时整条产品线的性价比格局可能还会再变一次。
参考
- Frontier Design,发布前参与评估的第三方机构 ↩︎
- Claude Opus 5.5 官方介绍:基准测试脚注,AutomationBench 结果由 Zapier 运行并报告 ↩︎
- Claude Opus 5.5 官方介绍:Communication 小节 ↩︎ ↩︎
- Claude Opus 5.5 官方介绍:开篇 Performance 段落 ↩︎
- Claude Opus 5.5 官方介绍:Coding 小节 ↩︎ ↩︎
- Claude Opus 5.5 官方介绍:Knowledge work 小节 ↩︎ ↩︎
