Anthropic于2026年6月9日发布最强模型ClaudeFable5,三天后因被发现可越狱识别软件漏洞遭美国政府出口管制,全球停服18天。回归时模型附带更严格安全分类器,虽能阻断超99%越狱但增加误杀,另推出越狱分级框架与四项政府承诺,标志着AI治理进入新阶段。
史上最强模型上线3天被政府叫停,全球用户集体中断服务,18天后带着更严格的安全审查回归。这不是科幻小说情节,而是2026年6月真实发生的事件。
图片来源:www.anthropic.com/news/claude…
长期稳定更新的攒劲资源: >>>点此立即查看<<<
6月9日,Anthropic发布了两款重磅模型——Claude Fable 5和Claude Mythos 5。
Fable 5定位清晰:Anthropic有史以来最强的公开发布模型。拥有1M token上下文、128k最大输出,自适应思维永久开启,50的定价是Opus 4.8的两倍。从Benchmark数据看,性能几乎全面领先。
图片来源:www.anthropic.com/news/claude…
14家公司站台背书,包括Cursor、GitHub、Vercel、Cognition、Replit、Databricks等主流开发者工具平台。Cursor表示,使用Fable 5一次性完成了以往需要迭代数天的系统;GitHub指出,其代码审查能力明显超过Opus 4.8。
发布消息引发行业兴奋。对于日常使用Claude Code的用户而言,Fable 5的“长程自主Agent”能力正是所需——它能自主处理复杂任务,持续数小时甚至数天不脱轨。
然而,3天后,一切戛然而止。
6月12日下午5点21分(美东时间),美国商务部向Anthropic发出出口管制指令。
原因在于,亚马逊研究人员发现了一种绕过Fable 5安全防护的方法,可使模型识别软件漏洞并生成漏洞利用代码。
Anthropic当天发布声明,措辞克制但表达不满。声明指出:
结论是:由于无法实时验证用户国籍,Anthropic选择全球中断服务,覆盖所有用户,包括美国本土。
图片来源:www.anthropic.com/news/fable-…
这一决定引发思考:AI模型的安全边界应由谁来划定?是开发公司,还是政府?
Anthropic自称,Fable 5的越狱被归类为Category C(轻微越狱),仅触及安全余量区,未触及核心有害行为。此外,1000多小时的外部红队测试也未发现任何通用型越狱。
但政府持不同看法。
Claude Fable 5事件时间线(2026年6月9日-7月1日)
接下来18天,事件逐步推进:
Anthropic在X平台上的帖子数据反映用户关注度:
60K点赞的13秒视频,直观体现了用户的等待心情。
Fable 5回归,但搭载了更严格的安全分类器。
Anthropic训练了新分类器,专门针对亚马逊报告的那种绕过方法,声称在超过99%情况下可阻断。被阻断请求将转发至Opus 4.8处理。
图片来源:www.anthropic.com/news/redepl…
代价是什么?Anthropic承认:更多误杀。
新分类器会在“正常的编码和调试任务”上产生更多误报。这意味着,用户编写正常功能代码时,分类器可能判定代码与漏洞利用相关,直接拒绝,并将请求转给Opus 4.8。
四个分类器监控如下:
| 分类器 | 拦截内容 | 误杀风险 |
|---|---|---|
| cyber | 进攻性网络安全技术 | 正常安全工作可能触发 |
| bio | 危险实验室方法 | 有益生命科学研究可能触发 |
| frontier_llm | 协助开发竞品AI模型 | 正常ML工作可能触发 |
| reasoning_extraction | 要求模型复述内部推理 | “展示你的思考过程”类提示会触发 |
最后一个分类器影响显著。如果用户之前的提示或指令中包含“show your thinking”或“explain your reasoning”等语句,Fable 5将直接触发reasoning_extraction拒绝,并降级至Opus 4.8。官方文档专门就此发出警告。
这意味着,许多Claude Code的自定义指令需要修改。
图片来源:www.anthropic.com/news/redepl…
许多人未明确的一点:Fable 5与Mythos 5实为同一模型,仅安全姿态不同。
| Claude Fable 5 | Claude Mythos 5 | |
|---|---|---|
| 能力 | 同Mythos 5 | 同Fable 5 |
| 安全分类器 | 有 | 无 |
| 可用性 | 公开发布 | 仅限Project Glasswing邀请 |
| 用途 | 通用知识工作、编码、Agent | 防御性网络安全 |
| 定价 | 50 | 50 |
Mythos 5无安全分类器,但仅面向通过Project Glasswing审核的网络安全防御方。该项目已帮助合作方发现超过10000个高危或严重安全漏洞,包括OpenBSD中一个27年的老bug和FFmpeg中一个16年的bug。
Anthropic策略本质:最强能力不设防,仅限受信任防御方;公开发布版本加装安全分类器,接受误杀以换取安全。
此逻辑易懂,但开发者更关注:在Fable 5上支付50费用,却被分类器降级至Opus 4.8,为何要付Fable 5的价格?
Anthropic为此推出Fallback Credit机制:被拒绝后重试至Opus 4.8时,将退还缓存写入的差价。但这一机制更多是“抱歉打扰了”,而非真正解决方案。
本次回归,Anthropic还携同亚马逊、微软和Google,共同提出越狱严重程度分级框架。
图片来源:www.anthropic.com/news/claude…
四个评分维度:
三个严重等级:
图片来源:www.anthropic.com/news/claude…
同时,Anthropic上线HackerOne漏洞赏金计划,专门征集Fable 5的网络越狱。24/7监控团队已就位。
这是整个事件中最有价值的产出。此前行业缺乏统一越狱分级标准,各家公司各说各话。如今四大AI公司达成共识,至少有了共同语言。
作为恢复服务的条件,Anthropic向美国政府做出四项承诺:
本质上,这是一种交易:若想恢复服务,须允许政府在模型发布前先行审查。
这一做法可能令人不适,但可以理解。政策制定者面对一个能自主发现10000个安全漏洞的AI模型,难免紧张。
问题在于边界何在。本次“窄域越狱”即触发全球停服。未来,一个Category C的越狱就能导致数亿用户断服18天,这一响应级别是否合理?
以下是对日常使用Claude API或Claude Code的开发者的实际建议:
第一,重视Fable 5的误杀问题。 尤其在做安全相关开发,或提示中包含“解释推理过程”等指令时,需提前配置回退机制。官方提供三种方式:服务端fallbacks参数(最简单)、SDK中间件、手动重试。
第二,Sonnet 5可能是更务实的选择。 同一天发布的Sonnet 5,定价15,性能接近Opus 4.8,网络安全防护比Fable 5宽松得多。官方明确表示,“Sonnet 5的网络安全风险整体较低”,甚至无法生成Firefox漏洞利用代码(0.0%),因此无需极端分类器。
第三,长程Agent任务仍值得使用Fable 5。 官方文档强调:“看到最好结果的团队,是将Claude Fable 5用于最难的未解决问题。仅用简单任务测试,会严重低估其能力范围。”但需接受现实:在安全相关任务上,它可能降级。
第四,注意Thinking行为变化。 Fable 5的原始思维链永不返回,仅返回摘要或省略。用户无法关闭Thinking,低Effort设置下的表现仍“经常超过此前模型的xhigh”。这是优点,但意味着无法像以前一样调试模型的推理过程。
结论:Fable 5回归是好事,但本次事件标志着AI治理进入新阶段——政府可因一个轻微越狱,就让全球最强AI模型停服18天。
技术判断: Fable 5确实是目前最强的公开发布模型,尤其在长程自主Agent和复杂编码场景中。但更严格的安全分类器使其实际可用性打了折扣,用户需为误杀做好准备。
行业判断: 本次事件设定了一个危险先例。亚马逊发现Category C越狱→政府全球叫停→18天后更严审查恢复,这一链条过短。若每次轻微越狱都走此流程,AI行业可能被监管拖累。好消息是,越狱分级框架的建立至少提供了讨论基础。
实践判断: 若不做安全相关开发,Fable 5仍是最佳选择。若从事安全开发,需认真配置回退,或考虑Sonnet 5作为替代。但无论选择哪个模型,都不应将其视为“永不中断”的基础设施——它已证明自己可能被叫停。
必须坦诚地说,对政府发布前预访问这一承诺是担忧的。一个商业AI模型发布前需经政府审查,在技术上如何实现?是否会演变为审批制?边界在哪里?这些问题尚未明确,但将是未来最值得关注的变量。
以下变量值得持续关注:
18天内,一个模型经历了发布、封杀与回归。此事意义不在于Fable 5本身有多强,而在于它揭示了:当AI能力强到一定程度,其命运不再仅由技术决定。