Claude Opus 5 发布:接近 Fable 5,价格维持 Opus 4.8 水平

Anthropic 正式发布 Claude Opus 5:API 价格与 Opus 4.8 持平,提供 100 万 Token 上下文、可调 Effort 和更强的长程 Agent 能力。对开发者而言,重点是以更可控的成本处理复杂编码和知识工作。

暖珊瑚色 Opus 5 立体数字雕塑、性能曲线与平衡秤
Claude Claude Opus 5 Anthropic AI 编程 大模型

Anthropic 于 2026 年 7 月 24 日正式发布 Claude Opus 5。它没有取代能力上限更高的 Claude Fable 5,而是把接近 Fable 5 的表现带到 Opus 的价格档位:API 输入价格为每百万 Token 5 美元,输出为 25 美元,与 Opus 4.8 相同。

Opus 5 已在 Claude 全平台上线,API 模型 ID 为 claude-opus-5。它成为 Claude Max 的默认模型,也是 Claude Pro 中能力最强的可用模型。对高频使用 Claude Code、开发 Agent 或处理复杂知识工作的团队,这次更新首先改变的是日常主力模型的选择。

价格不变,能力档位向上移动

Opus 5 的定位很清楚:在多数编码和知识工作中接近 Fable 5,同时把单次任务成本控制在 Opus 级别。核心规格如下:

项目

Claude Opus 5

API 模型 ID

claude-opus-5

上下文窗口

100 万 Token,默认值也是最大值

最大输出

128k Token

标准 API 价格

输入 5 美元 / 百万 Token;输出 25 美元 / 百万 Token

Fast mode

约为默认速度的 2.5 倍;价格为标准模式的两倍

默认思考设置

开启

Effort 档位

lowmediumhighxhighmax

Fast mode 目前是 Claude API 的研究预览,尚未在 Amazon Bedrock、Google Cloud 和 Microsoft Foundry 提供。它适合等待时间直接影响业务的场景,普通开发任务则更适合先用标准模式和 Effort 调节成本。

跑分指向“更会把任务做完”

Anthropic 公布的评测显示,Opus 5 在软件工程、知识工作、计算机操作和科学研究上均有明显进步。在 CursorBench 3.2 的最高 Effort 设置下,它与 Fable 5 峰值成绩相差不到 0.5%,但官方测得的单任务成本约为后者一半;在 Frontier-Bench v0.1 上,其表现超过 Opus 4.8 两倍以上,同时单任务成本更低。

这些结果来自厂商及合作伙伴评测,不能直接替代真实项目验收。不过多个案例集中指向一个变化:Opus 5 更愿意检查假设、定位根因、补充测试,并在第一次方案失败后继续迭代。它的优势不只是一次生成更多代码,而是在长时间、多步骤任务中保持目标并完成交付。

科研能力也有提升。Anthropic 的内部生命科学评测覆盖结构生物学、有机化学和生物信息学,其中光谱数据推断分子结构的成绩比 Opus 4.8 高 10.2 个百分点,蛋白质序列变异影响预测高 7.7 个百分点。这些数字更适合用来判断能力方向,涉及科研结论时仍需专业人员复核。

开发者更该关注的四个变化

思考默认开启,Effort 决定成本边界

Opus 4.8 需要显式设置才能启用自适应思考,Opus 5 则默认开启,并通过 Effort 控制推理深度。官方建议从默认的 high 开始,再根据自有评测向上或向下调整。

迁移时要重新检查 max_tokens。该参数同时限制思考和最终回答,如果沿用过去为非思考请求设置的较小数值,模型可能没有足够空间完成任务。关闭思考时,Effort 只能设为 high 或更低;与 xhighmax 同时使用会返回 400 错误。

短提示词也更容易命中缓存

Opus 5 的 Prompt 缓存最小长度从 Opus 4.8 的 1024 Token 降到 512 Token。固定系统指令、工具描述或较短的业务上下文,有更多机会直接建立缓存。对大量重复调用的小团队,这是比单次跑分更容易落到账单上的改进。

对话中可以调整工具

Claude Platform 新增“对话中修改工具”beta。开发者可以在同一会话的不同阶段添加或移除工具,并保留 Prompt 缓存,不必从一开始就把完整工具集固定下来。这有利于缩小每个阶段的可操作范围,也减少因工具列表变化而重复处理长上下文。

安全拒绝可配置自动回退

API 同时加入自动回退 beta。Opus 5 请求触发安全分类器时,可以按拒绝类型路由到 Anthropic 推荐的其他模型。回退能避免长任务直接中断,但模型变化也会带来行为和质量差异,生产系统仍要单独记录回退率、输出质量与成本。

小团队可以先测哪些场景

如果团队已经在使用 Opus 4.8,不必只用通用问答比较两个模型。优先选择能暴露长程执行差异的真实任务:

  1. 跨文件 Bug 修复:给出完整仓库和可复现用例,检查模型是否找到根因、补齐边界测试,而非只消除表面报错。
  2. 中型功能交付:让模型从需求澄清开始,完成实现、测试和文档,记录总 Token、工具调用次数、人工接管次数与最终通过率。
  3. 长文档或数据分析:在 100 万 Token 上下文中放入真实材料,检查关键约束是否在后半程仍被遵守。
  4. 不同 Effort 的成本曲线:用同一组任务比较 mediumhighxhigh,找到成功率开始明显提升的位置,不要默认把每个请求都开到 max

任务类型

建议起点

观察重点

文案、代码解释、小脚本

lowmedium

延迟、Token 与基本准确率

常规功能和 Bug 修复

high

测试通过率与人工修改量

大仓库迁移、复杂根因分析

xhigh

长程一致性与工具调用质量

高失败成本任务

max 加人工验收

风险控制、可追溯性与回滚方案

Opus 5 仍有明确边界

Opus 5 在官方行为审计中的整体失调行为得分为 2.3,是 Anthropic 近期模型中的最低值。它在源代码漏洞发现上接近 Mythos 5,但在漏洞利用能力上明显落后。针对二进制漏洞扫描、渗透测试和利用代码生成等请求,平台设置了更严格的限制。

Fable 5 仍适合能力上限优先、链路特别长且失败代价高的任务;Opus 4.8 也会继续在各平台提供。已有稳定生产链路的团队应先做 A/B 验收,再逐步切换模型 ID。尤其要检查旧系统提示中重复的“再次验证”或“派子 Agent 复核”规则,因为 Opus 5 本身会更主动地自检,叠加过多硬性复核可能只会增加工具调用和 Token 消耗。

Claude Opus 5 最实际的价值,是让复杂编码和知识工作不必每次都为最高能力档位付费。下一步应关注的不是榜单名次,而是它在自有任务上的成功率、总耗时、回退比例和人工验收成本。