2026 年 9 月 1 日,Anthropic 同时发布 Claude Fable 5.1 和 Claude Mythos 5.1。社区里很快出现了两种反馈:有人把 medium effort 称作“甜点位”,说它能跑出上一代的效果;也有人抱怨 high effort 一开,额度很快就见底。标题可以夸张,问题却很实际。模型如果要连续工作更久,能力提升能不能覆盖额外的推理和 token 消耗?
这次更新值得看的地方,就在于 Anthropic 把能力、成本和安全边界放在了一起。Fable 5.1 与 Mythos 5.1 使用同一基础模型,区别在于安全防护等级。Fable 5.1 已全面可用,Mythos 5.1 只向网络安全和生命科学领域的可信访问计划开放。换句话说,同一套长周期能力被放进了不同的使用边界里。
长周期 Agent,增加的不是回答长度
长周期 Agent 的关键,是任务能否持续往前走。模型先读取上下文,决定下一步;调用工具得到结果后,检查结果是否符合预期;发现偏差,再修改方案并继续执行。真正影响体验的,是它能不能保持方向,留下可以验收的中间结果,而不是一次性生成一段看起来完整的说明。
官方 benchmark 已经把这项变化量化出来。在 Terminal-Bench-Science 0.1 中,Fable 5.1 在最高 effort 下得分 52.6%,Fable 5 为 24.7%。Terminal-Bench 4.0 上,Fable 5.1 为 55.8%,Fable 5 为 42.0%,同一张表里的 Mythos 5.1 达到 60.9%。这些结果来自 Anthropic 的测试条件,不能直接当成每个项目的成功率,但足以说明 Fable 5.1 的目标已经从快速回答扩展到完成复杂任务。

图:Anthropic 官方公布的 Fable 5.1、Fable 5、Mythos 5.1 与其他模型的多项评测结果。来源:https://x.com/claudeai/status/2094848581425377479
合作方的披露让这个变化更容易理解。MongoDB 表示,模型先阅读服务代码和文档,再连续数小时无人值守地实现原型并运行验证;Ramp 分享过一次持续 38 小时的机器学习任务,模型在实验出错后自行修正,继续启动并行实验,最后返回结果和下一步建议。这些是 Anthropic 发布的合作方内部记录,不是作者实测,却清楚展示了长周期工作的样子。
能力变强以后,账单怎么算
长任务的成本不能只看输入和输出单价。每次工具调用都会带来新的上下文,模型还可能重复读取已经处理过的内容,所以需要把 effort、工具调用轮数、总 token 和 cache read 分开记录。任务少走几轮弯路,往往比单价便宜几分钱更有价值;如果高 effort 让任务变长,成本也会跟着上升。
Anthropic 给出的变化很明确:Fable 5.1 的 cache read 价格比 Fable 5 低 75%,典型工作负载预计节省约 25%,高度 Agent 化的任务最高可节省约 45%。这不是所有业务都能拿到的固定折扣,实际效果取决于上下文重复率、工具调用次数和任务是否需要返工。长周期任务反复读取相同上下文时,缓存命中越多,降价越能反映到实际账单。

图:Anthropic 官方按典型工作负载和高度 Agent 化工作负载展示 Fable 5.1 的成本下降。来源:https://x.com/claudeai/status/2094848588190830982
官方的 Terminal-Bench-Science 成本曲线也显示了 effort 的代价。Fable 5.1 在 low effort 下得分 26.3%,平均任务成本为 11.1 美元;max effort 下得分升到 52.6%,平均成本则为 37.9 美元。模型可以更努力,但每一档 effort 都应该对应明确的任务价值,不必默认拉到最高。

图:Anthropic 官方公布的 Humanity’s Last Exam 准确率与任务成本关系,展示不同 effort 档位的成本梯度。来源:https://x.com/claudeai/status/2094848585451847721
安全边界会决定你能把任务交给谁
Agent 越能自主执行,安全策略越会影响可用性。评估新模型时,要同时确认它允许做什么、哪些请求会被拦截、被拦截后是否转交更高等级模型,以及企业数据最终由谁控制。
Fable 5.1 的网络安全防护误报减少 60%,基础生物和医疗问题的误触发减少约 85%。它现在可以用于发现软件漏洞,但不能用来开发漏洞利用程序;渗透测试、漏洞利用生成和二进制漏洞扫描等双重用途任务,仍可能被转交 Opus。Mythos 5.1 面向通过审核的网络安全和生命科学专业用户,普通开发者不能把它当成随时可调用的公共版本。
企业还要关注数据保留。Anthropic 正在推出 Enterprise Frontier Safeguards,把数据存放在客户完全控制的云基础设施中,目标是达到与零数据保留相同的隐私效果,预计从 2026 年秋季开始分阶段开放。在此之前,符合条件的客户可以使用 Fable 5.1 的零数据保留选项。模型能力、权限和数据边界,应放在同一张接入清单里判断。

图:EFS 的官方工作流程图。API 请求进入客户自己的云基础设施后,活动数据由自动安全系统监测,告警先交给客户安全团队,Anthropic 只接收告警类别和严重程度等元数据。来源:https://www.anthropic.com/news/enterprise-frontier-safeguards
别只看榜单,先跑一个能验收的小任务
准备把 Fable 5.1 放进 Agent 工作流时,先挑一个小而完整的任务。它应该涉及多个文件或资料,需要调用工具,最后有明确的检查命令或通过条件。用同一份输入分别跑 low、medium 和 high effort,记录任务是否完成、工具调用是否有效、有没有重复兜圈、总 token、cache read、总耗时和失败重试次数。
这组记录比单次问答更接近真实接入判断,能看出额外推理是否换来了更高的完成质量,也能验证 cache read 降价是否反映在自己的账单里。准备通过 API 接入时,可以先查看该模型的价格、计量口径、模型适配和稳定性数据,再决定从哪条服务开始小额验证。

图:OkenAI平台 Claude Fable 5.1 价格列表,来源:https://oken.ai/zh
结语
Fable 5.1 的变化,不只是 benchmark 表上多了几个百分点。更长的任务循环、更低的 cache read 成本和更细的安全分层,被放进了同一次更新。复杂代码审查、持续研究和多轮工具调用的 Agent 工作流,值得优先验证;简单问答没有必要为了追新版本而切换,高敏感任务则要先确认权限和数据政策。
因此,接入判断不应停在“要不要换成 Fable 5.1”。先按价格、计量、适配和稳定性筛掉不合适的 API 服务,再用自己的真实任务记录 effort、token 和完成结果。只有任务确实完成得更好,成本也在可接受范围内,这次升级才真正落到了工作流里。
如果还要确认新模型上线后的 API 服务是否完成适配,可以继续阅读我的另一篇文章《新模型发布后,API 服务真的适配好了吗?接入前检查这 4 项》。






