Claude Fable 5.1 与 Mythos 5.1 发布:缓存读取降价 75%,长任务成主战场
Anthropic 发布同源的 Claude Fable 5.1 与 Mythos 5.1:前者全面开放,后者继续限于受信任机构。新版强化长任务、编程和科研能力,并将缓存读取价格降至每百万词元 0.25 美元。
Anthropic 于 2026 年 9 月 1 日发布 Claude Fable 5.1 和 Claude Mythos 5.1。两者使用同一个底层模型,差别主要在安全防护和开放范围:Fable 5.1 已向普通用户和开发者开放,Mythos 5.1 只提供给通过审核的网络安全与生命科学机构。
这次更新没有下调输入、输出词元的基础单价,真正降价的是长任务里会反复使用的缓存内容。Fable 5.1 的缓存读取价格降至每百万词元 0.25 美元,比上一代低 75%。Anthropic 估算,典型工作负载的总体成本约下降 25%,上下文和工具调用较多的智能体任务最多可节省约 45%。
同一个模型,分成两种开放方式
Fable 5.1 是公开版本,可在 Claude 的 Pro、Max、Team 和 Enterprise 方案中使用,也已进入 Claude API、Amazon Web Services、Google Cloud 与 Microsoft Foundry。API 模型标识为 claude-fable-5-1。
Mythos 5.1 的规格和价格与 Fable 5.1 相同,但对网络安全和生命科学任务采用更宽松、面向专业研究的防护策略。它目前只对一部分经过审核的美国机构开放,渠道包括网络安全验证计划和生命科学验证计划。Anthropic 表示会扩大范围,但没有给出国际开放时间表。
项目 | Claude Fable 5.1 | Claude Mythos 5.1 |
|---|---|---|
底层模型 | 与 Mythos 5.1 相同 | 与 Fable 5.1 相同 |
开放范围 | 普通用户、企业和开发者 | 经审核的机构,当前限部分美国组织 |
主要用途 | 编程、知识工作、长时间智能体任务 | 受控的网络安全与生命科学研究 |
API 标识 | | |
上下文窗口 | 100 万词元 | 100 万词元 |
最大输出 | 12.8 万词元 | 12.8 万词元 |
公开版本仍会限制高风险请求。Fable 5.1 可以协助发现软件漏洞,但渗透测试、漏洞利用生成和基于二进制文件的漏洞扫描等任务,仍可能被转交给能力较低的 Opus 模型。API 客户需要自行配置新的 Fallback API 才能使用这套转交流程。
性能提升集中在长时间、可执行的任务
Anthropic 公布的结果显示,Fable 5.1 相比 Fable 5 的明显提升主要出现在智能体科研、终端编程和业务自动化,而不是每一项推理测试都大幅上涨。
基准 | Fable 5.1 | Fable 5 | Opus 5 |
|---|---|---|---|
Terminal-Bench-Science 0.1 | 52.6% | 24.7% | 29.0% |
Terminal-Bench 4.0 | 55.8% | 42.0% | 52.3% |
AutomationBench | 31.4% | 17.1% | 26.9% |
CursorBench 3.2.0 | 73.4% | 70.5% | 70.0% |
GDPval-AA v2 | 1853 | 1723 | 1824 |
Mythos 5.1 在 Terminal-Bench 4.0 得到 60.9%,高于 Fable 5.1 的 55.8%。Anthropic 将这部分差距归因于安全防护对任务的介入,并称新版防护变得更精确后,两者的实际差距应会缩小。
这些数字来自厂商测试,不适合直接换算成“日常开发效率提升多少”。不同基准使用的工具、测试集和安全设置并不一致。比如 Terminal-Bench-Science 的单模型标准误差约为 3.5 至 4.5 个百分点;部分 OSWorld 和 AutomationBench 任务还会因为防护机制介入而记为零分。选型时应把官方基准当作确定测试方向的线索,而不是采购结论。
缓存降价比基础单价更值得算一遍
Fable 5.1 的输入价格仍是每百万词元 10 美元,输出为 50 美元,价格不低。缓存读取降到每百万词元 0.25 美元后,固定上下文被多次复用的任务会先受益,例如大型代码仓库分析、长文档研究、带工具的多轮 Agent 和持续数小时的 Claude Code 会话。
对小团队来说,不能只看“缓存便宜了 75%”。实际节省多少,取决于总账单里缓存读取原本占多大比例。一次性问答、短文本生成或每轮上下文变化很大的流程,成本下降可能远小于官方给出的 25%;反复读取同一代码库、规范文档和历史状态的任务,才更接近高度智能体化场景。
可以用现有任务做一轮对照,不必先迁移全部流量:
- 选一个会运行数小时、且能重复执行的真实任务,例如跨仓库改动或深度调研;
- 固定输入材料、工具权限、验收标准和最大预算;
- 分别记录 Fable 5 与 Fable 5.1 的输入、输出、缓存读取、重试次数和人工接管时间;
- 以“通过验收的一次任务”为单位比较成本,不只比较每百万词元单价。
防护误报减少,但数据边界仍要单独检查
Anthropic 称,Fable 5.1 的新版网络安全防护让 Claude Code 每次会话受到的干预平均减少约 60%;面向基础生物学与一般医疗问题的良性请求,触发相关防护的频率比 Fable 5 发布时低 85%。这两组数字描述的是防护介入频率,不等于模型在这些领域的准确率提高了相同比例。
企业数据处理方面,Anthropic 同时公布了 Enterprise Frontier Safeguards。该方案把客户数据保存在企业控制的云基础设施中,并允许符合条件的客户在保留自动化安全检查的同时获得接近零数据保留的隐私边界。EFS 计划从 2026 年秋季开始分阶段推出;上线前,符合条件的客户可以为 Fable 5.1 申请零数据保留。普通情况下,Fable 仍默认保留数据 30 天用于安全监控。
Fable 5.1 的文本输出还加入了不可见水印,以满足欧盟《人工智能法案》相关透明度要求。水印不包含用户、机构或对话信息,检测 API 目前处于私人预览阶段。对需要处理客户代码、合同、医疗或科研数据的团队,是否能使用零数据保留、数据落在哪个云环境、谁能进行人工审核,仍应在接入前逐项确认。
小团队先验证三件事
Fable 5.1 的优先测试对象,是此前因为持续时间、上下文规模或重试成本而难以交给模型的任务,普通聊天反而很难体现这次更新的差异。
- 长任务是否真的能跑完。 观察模型能否在数小时后保持目标、记录进度、处理失败并给出可复查的结果。
- 缓存是否形成实际节省。 从账单中拆出缓存读取占比,核算每个验收通过任务的成本。
- 安全转交是否影响流程。 网络安全、生物学或其他敏感领域要测试请求被限制或转交后的模型、质量和计费变化。
Mythos 5.1 对多数团队暂时不是可选项。它的意义更多在于展示 Anthropic 如何把同一个高能力模型拆成公开版和受控版:普通开发者拿到 Fable 5.1 的长任务能力,敏感领域的更宽松能力继续留在审核计划内。
眼下能直接做决定的是 Fable 5.1。已经在 Claude Code、Claude API 或长上下文 Agent 上投入较多的团队,可以优先测试它是否降低了单个可交付任务的成本;以短问答和轻量生成为主的团队,则没有必要仅凭缓存降价立即迁移。Mythos 5.1 何时扩大到更多国家和机构,仍是这次发布留下的主要变量。