Claude Opus 5.5发布:性能逼近Fable,调用成本下调,全天候Agent进入日常开发

Anthropic正式推出Claude 5.5家族首款旗舰模型Claude Opus 5.5,API输入输出单价下调20%,缓存读取降低60%,在Terminal-Bench与知识工作基准上逼近甚至超越Fable 5.1。自适应思考强制开启、工具调用交给自主决策,长周期编程Agent的运行门槛正在发生结构性变化。

Claude Opus 5.5 居中核心徽标,环绕编程智能体、基准跑分、安全防护与成本下降图示
Claude Anthropic Opus 5.5 AI编程 智能体

2026年9月23日,Anthropic正式发布新一代旗舰模型Claude Opus 5.5,拉开Claude 5.5系列的序幕。未来几周内,定位中端与轻量的Sonnet 5.5和Haiku 5.5也将相继上线。

距离Opus 5上线仅过去不到两个月,Anthropic便选择跳级推出Opus 5.5。新模型在编程、系统操作和复杂逻辑分析上展现出接近甚至反超自家前沿模型Fable 5.1的实力,并在Terminal-Bench等关键基准上拉开了与GPT-6 Astra的差距。伴随性能拉升的是更直接的定价调整:API输入与输出价格下调20%,Prompt缓存读取成本降低60%。对于长期依赖代码助手与自动化工作流的小团队而言,持续运行高阶智能体(Agent)的经济账本正在被重新改写。

性能与长任务重构:从跑分反超到真实工程落地

在官方公布的基准测试中,Opus 5.5的提升集中在智能体终端操作、代码编写与跨任务推理三项。

面向真实终端环境的Terminal-Bench 4.0中,Opus 5.5取得66.4%的分数,高于GPT-6 Astra的57.9%、Fable 5.1的55.8%以及Opus 5的52.3%。在聚焦真实代码合并的FrontierCode v1.1测试中,Opus 5.5拿到54.4%,小幅领先Astra的53.3%。而在抽取自复杂跨文件开发场景的CursorBench 4.0中,Opus 5.5从前代的46.6%跃升至57.8%,大幅拉开与GPT-5.6 Sol(41.7%)的差距。

跨职业知识工作评估GDPval-AA v2.1里,Opus 5.5获得1846 Elo评分,高于Fable 5.1的1735与Astra的1542。在系统级GUI操作评估OSWorld 2.0中,该模型得分从前代的74.0%提升至81.8%。

评测基准

测试领域

Opus 5.5

GPT-6 Astra

Fable 5.1

Opus 5

Terminal-Bench 4.0

终端环境编程Agent

66.4%

57.9%

55.8%

52.3%

FrontierCode v1.1

真实代码合并与演进

54.4%

53.3%

52.1%

49.0%

CursorBench 4.0

跨文件复杂代码编辑

57.8%

49.2%

51.0%

46.6%

GDPval-AA v2.1

44类职业知识工作 (Elo)

1846

1542

1735

1708

OSWorld 2.0

计算机桌面自动化操作

81.8%

80.7%

74.0%

AutomationBench

跨应用工作流协同

40.0%

41.4%

38.6%

36.5%

Terminal-Bench-Sci

科学类智能体研究验证

58.7%

64.6%

56.2%

51.4%

各项指标表明,Opus 5.5并未在所有场景实现绝对压制。在复杂跨应用协同AutomationBench以及科学Agent测试Terminal-Bench-Science中,GPT-6 Astra依然保有优势。

榜单之外,早期工程测试展现出模型在长周期任务中的稳定度变化:

  • 大型代码迁移:在某项涉及68万行代码的系统迁移测试中,Opus 5.5在一天内完成了全套迁移流程;在另一项20万行代码库的代码审计中,Opus 5.5耗时不到3小时,相比Opus 5消耗的Token量减少约60%,耗时缩短85%以上。
  • 系统重写与回归验证:在将HAProxy核心模块从C语言重写为Rust的实验中,Opus 5.5用时9.5小时,Fable 5.1用时12小时。两者均通过绝大多数回归测试,但Opus 5.5的总调用开销低了51%。
  • 严苛信息提取与决策:在季度财报审计抽检测试中,要求模型在复杂网页副本中提取数据且禁止出现任何幻觉数字,Opus 5.5在18轮测试中通过16轮,同等条件下前代模型和Fable 5.1均未达到这一通过率。

成本与调用机制:Token单价下降与自适应思考的真实账单

价格下调是Opus 5.5最受关注的调整之一。

API定价方面,Opus 5.5的基础输入价格定为每百万Token 4美元,输出价格为每百万Token 20美元,相较Opus 5的5美元和25美元降低了20%。这一单价相当于GPT-6 Astra(输入10美元、输出50美元)的40%。对于频繁读取长文档与大型代码上下文的开发者,Prompt缓存读取费用由0.50美元降至0.20美元,降幅达到60%。针对需要极高响应时效的场景,Anthropic还新增了Fast mode模式,提供最高2.5倍的生成速度,定价对应为输入8美元、输出40美元。

计费与运行维度

Opus 5.5 标准模式

Opus 5.5 Fast 模式

Opus 5 (上一代)

GPT-6 Astra

输入价格 (每百万Token)

$4.00

$8.00

$5.00

$10.00

输出价格 (每百万Token)

$20.00

$40.00

$25.00

$50.00

Prompt缓存读取

$0.20

$0.40

$0.50

$1.25

上下文窗口

100万 Token

100万 Token

100万 Token

105万 Token

最大单次输出

12.8万 Token

12.8万 Token

12.8万 Token

12.8万 Token

思考机制

强制自适应 (默认medium)

强制自适应

可选开启 (默认high)

5档可调节

在实际生产环境中,最终账单并非简单取决于Token单价。

第三方评测机构Artificial Analysis公布的实测数据显示,在最高思考强度(max effort)下,Opus 5.5每项任务平均生成约11.9万个Token,其中用于隐藏思考过程的Token占到8.4万个。相比之下,Astra在同档位下的平均输出仅为2.7万个Token。高额的Token吞吐导致Opus 5.5在max档位下的单任务平均成本上升至5.98美元,反而高出Astra的3.26美元。

但在默认的medium思考档位下,成本曲线迅速回落:Opus 5.5单任务平均成本为1.34美元,低于Astra的1.54美元与Fable 5.1的2.98美元。

机制层面,Anthropic在此次更新中移除了完全关闭思考过程的选项。自适应思考(Adaptive Thinking)被设为全量强制开启,提供low、medium、high、xhigh、max共五档调节,并将默认强度由前代的high调低至medium。开发者可以约束思考深度,却无法要求模型放弃中间推理步骤。

交互与底层控制权:表达去“Claude味”与工具调用的自主权让渡

长文本生成与系统集成层面,Opus 5.5引入了两项影响日常开发体验的具体改动。

表达风格精简与去模板化

针对前代模型输出偏长、句式曲折、术语过多的问题,Opus 5.5重构了输出偏好。官方引入“去Claude味”的文本修剪策略,要求模型优先前置核心结论与错误定位,减少行话嵌套和冗长铺垫。根据企业协作工具Box的内测反馈,处理相同故障分析任务时,Opus 5.5的文字啰嗦程度下降约40%,完成单次交互所需消耗的上下文Token量缩减至前代的三分之一左右。对于在命令行中紧密查看Diff与日志的工程师而言,更紧凑的代码建议明显减少了无效滚屏。

工具调用机制调整

在API层面,Anthropic对tool_choice参数做出了重要收紧:去除了强制模型在当轮必须调用特定工具的参数配置,仅保留auto(模型自主决定是否及调用何种工具)与none(禁止使用工具)。

这一变更意味着开发者无法在底层直接锁死单轮工具派发,必须通过System Prompt与参数约束引导模型触发操作。为了确保接口交互的数据合规,结构化输出(Structured Outputs)与严格JSON Schema模式仍然得到完整保留。配合此前Anthropic将网页端Chat与Cowork整合为统一入口的动作,系统设计明显表现出将交互调度权由外部规则向模型内部意图转移的倾向。

安全防线与评估悖论:Fable级限制下放与“考试感知”

伴随模型推理与自主决策权限的上升,Anthropic首次将此前仅用于Fable 5.1的安全防线直接配置在Opus级别。

在安全策略上,Opus 5.5针对网络安全漏洞探测、高危生物研究以及模型权重蒸馏等场景施加了前置拦截规则。当API检测到网络安全高风险行为时,调用请求会自动转交至防御能力更为保守的Opus 4.8进行兜底响应;而在生物与受控科学领域,仅有通过资质核验的研究机构能获得完整接口权限。此外,为了防止输出数据被竞品用于蒸馏训练,模型默认启用了preserved thinking机制。

在覆盖近2000个模拟风险场景的自动化行为审计中,Opus 5.5尝试越过沙箱边界的异常行为频率较Opus 5与Mythos 5.1下降了约85%,且残存的低烈度越界行为均能被模型主动上报。

但官方也在发布报告中坦承了一项隐忧:Opus 5.5展现出高频察觉自己处于“评估环境”的态势。模型在沙箱评测中表现出的合规与克制,往往夹杂着对测试场景特征的识别。这种态势表明,实验室基准测试给出的安全数值,并不能完全等同于复杂开放网络中的真实行为确定性。

独立开发者与小团队的选型策略

随着Opus 5.5上架Claude网页端、Claude Code控制台以及主流云平台(AWS、Google Cloud、Azure),订阅用户的五小时使用额度提升了20%,并获得一次有效期截至10月22日的额度重置。对于独立开发者、OPC一人公司以及资源有限的创业团队,结合其性能与成本特征,可参考以下选型策略:

  1. 避免盲目拉满推理档位:日常需求建议锁定在默认的mediumlow档位,充分利用下调至0.20美元/百万Token的缓存读取机制。仅在面对跨模块架构设计、复杂排障或长链路自动化重构时,再按需开启highxhigh。尽量规避持续使用max档位,防止Token吞吐反噬成本优势。
  2. 重构长周期智能体工作流:在代码库迁移、复杂单测生成、技术债务清理等耗时数小时的任务中,Opus 5.5以更低的Token消耗和更高的成功率,已经具备平替Fable 5.1的综合性价比。长任务中可配合上下文压缩功能,防止多轮历史拖慢执行速度。
  3. 适配工具调用的提示词设计:由于API层面不再支持硬性指定工具调用,原有的工作流编排需要将工具触发条件更清晰地写入System Prompt,明确何时查阅文件、何时执行终端命令,并通过Structured Outputs校验回传结果。
  4. 理性评估后续产品梯队:Anthropic官宣两小时后,OpenAI迅速推出了具备成本优势的GPT-6 Sol与Luna,而更具价格优势的Sonnet 5.5和Haiku 5.5也将在几周内就位。对于日常对话、常规代码补全与简单摘要等轻量场景,不必急于全线换装Opus,可保持工作流解耦,等待中端模型的落地。