首页 > AI教程 >Claude Fable 5被美国政府封杀18天后回归,代价是什么?

Claude Fable 5被美国政府封杀18天后回归,代价是什么?

来源:互联网 2026-07-12 06:27:02

Anthropic于2026年6月9日发布最强模型ClaudeFable5,三天后因被发现可越狱识别软件漏洞遭美国政府出口管制,全球停服18天。回归时模型附带更严格安全分类器,虽能阻断超99%越狱但增加误杀,另推出越狱分级框架与四项政府承诺,标志着AI治理进入新阶段。

史上最强模型上线3天被政府叫停,全球用户集体中断服务,18天后带着更严格的安全审查回归。这不是科幻小说情节,而是2026年6月真实发生的事件。

图片来源:www.anthropic.com/news/claude…

长期稳定更新的攒劲资源: >>>点此立即查看<<<

事件背景:发布与停服

6月9日,Anthropic发布了两款重磅模型——Claude Fable 5和Claude Mythos 5。

Fable 5定位清晰:Anthropic有史以来最强的公开发布模型。拥有1M token上下文、128k最大输出,自适应思维永久开启,10/10/50的定价是Opus 4.8的两倍。从Benchmark数据看,性能几乎全面领先。

图片来源:www.anthropic.com/news/claude…

14家公司站台背书,包括Cursor、GitHub、Vercel、Cognition、Replit、Databricks等主流开发者工具平台。Cursor表示,使用Fable 5一次性完成了以往需要迭代数天的系统;GitHub指出,其代码审查能力明显超过Opus 4.8。

发布消息引发行业兴奋。对于日常使用Claude Code的用户而言,Fable 5的“长程自主Agent”能力正是所需——它能自主处理复杂任务,持续数小时甚至数天不脱轨。

然而,3天后,一切戛然而止。

3天:从发布到全球封杀

6月12日下午5点21分(美东时间),美国商务部向Anthropic发出出口管制指令。

原因在于,亚马逊研究人员发现了一种绕过Fable 5安全防护的方法,可使模型识别软件漏洞并生成漏洞利用代码。

Anthropic当天发布声明,措辞克制但表达不满。声明指出:

  • 这些漏洞是“相对简单的已知漏洞”;
  • 许多能力较弱的模型,包括Claude Opus 4.8、GPT-5.5、Kimi K2.7,同样能识别这些漏洞;
  • 测试中,包括Haiku 4.5和多个Opus版本在内的各模型,都能生成类似漏洞演示代码;
  • 政府仅提供“口头证据”,证明可能存在一种窄域、非通用型的越狱。

结论是:由于无法实时验证用户国籍,Anthropic选择全球中断服务,覆盖所有用户,包括美国本土。

图片来源:www.anthropic.com/news/fable-…

这一决定引发思考:AI模型的安全边界应由谁来划定?是开发公司,还是政府?

Anthropic自称,Fable 5的越狱被归类为Category C(轻微越狱),仅触及安全余量区,未触及核心有害行为。此外,1000多小时的外部红队测试也未发现任何通用型越狱。

但政府持不同看法。

18天:安全博弈与回归

Claude Fable 5事件时间线(2026年6月9日-7月1日)

接下来18天,事件逐步推进:

  • 6月26日:Mythos 5获准恢复,仅供部分美国关键基础设施运营方使用;
  • 6月27日:Anthropic在X平台发文,表示正“密切配合政府工作”;
  • 6月30日:商务部解除出口管制;同日,Anthropic发布“Redeploying Fable 5”博客,并同时发布Sonnet 5;
  • 7月1日:Fable 5全球恢复可用。

Anthropic在X平台上的帖子数据反映用户关注度:

  • 出口管制解除帖:84K点赞,13K转发,1300万浏览;
  • 重新部署帖:42K点赞,6.4K转发,1300万浏览;
  • “Fable 5 is back.”(由@claudeai发布13秒视频):60K点赞,8K转发。

60K点赞的13秒视频,直观体现了用户的等待心情。

回归后的变化:更严格的安全审查

Fable 5回归,但搭载了更严格的安全分类器。

Anthropic训练了新分类器,专门针对亚马逊报告的那种绕过方法,声称在超过99%情况下可阻断。被阻断请求将转发至Opus 4.8处理。

图片来源:www.anthropic.com/news/redepl…

代价是什么?Anthropic承认:更多误杀。

新分类器会在“正常的编码和调试任务”上产生更多误报。这意味着,用户编写正常功能代码时,分类器可能判定代码与漏洞利用相关,直接拒绝,并将请求转给Opus 4.8。

四个分类器监控如下:

分类器拦截内容误杀风险
cyber进攻性网络安全技术正常安全工作可能触发
bio危险实验室方法有益生命科学研究可能触发
frontier_llm协助开发竞品AI模型正常ML工作可能触发
reasoning_extraction要求模型复述内部推理“展示你的思考过程”类提示会触发

最后一个分类器影响显著。如果用户之前的提示或指令中包含“show your thinking”或“explain your reasoning”等语句,Fable 5将直接触发reasoning_extraction拒绝,并降级至Opus 4.8。官方文档专门就此发出警告。

这意味着,许多Claude Code的自定义指令需要修改。

图片来源:www.anthropic.com/news/redepl…

Fable 5与Mythos 5的关系

许多人未明确的一点:Fable 5与Mythos 5实为同一模型,仅安全姿态不同。

Claude Fable 5Claude Mythos 5
能力同Mythos 5同Fable 5
安全分类器
可用性公开发布仅限Project Glasswing邀请
用途通用知识工作、编码、Agent防御性网络安全
定价10/10/5010/10/50

Mythos 5无安全分类器,但仅面向通过Project Glasswing审核的网络安全防御方。该项目已帮助合作方发现超过10000个高危或严重安全漏洞,包括OpenBSD中一个27年的老bug和FFmpeg中一个16年的bug。

Anthropic策略本质:最强能力不设防,仅限受信任防御方;公开发布版本加装安全分类器,接受误杀以换取安全。

此逻辑易懂,但开发者更关注:在Fable 5上支付10/10/50费用,却被分类器降级至Opus 4.8,为何要付Fable 5的价格?

Anthropic为此推出Fallback Credit机制:被拒绝后重试至Opus 4.8时,将退还缓存写入的差价。但这一机制更多是“抱歉打扰了”,而非真正解决方案。

越狱分级框架:本次新成果

本次回归,Anthropic还携同亚马逊、微软和Google,共同提出越狱严重程度分级框架。

图片来源:www.anthropic.com/news/claude…

四个评分维度:

  1. 能力增益:越狱是否让AI做到现有工具无法实现的事?
  2. 能力增益广度:仅针对一个窄域目标,还是覆盖多个攻击任务?
  3. 武器化难度:需要多少专业技能才能利用?
  4. 可发现性:有多容易被找到?

三个严重等级:

  • C(轻微越狱):闯入安全余量,未触及核心内容——本次亚马逊报告即属此级;
  • D(窄域有害越狱):解锁特定有害行为;
  • E(通用越狱):解锁大范围有害行为,最为严重。目前Fable 5尚未发现这种越狱。

图片来源:www.anthropic.com/news/claude…

同时,Anthropic上线HackerOne漏洞赏金计划,专门征集Fable 5的网络越狱。24/7监控团队已就位。

这是整个事件中最有价值的产出。此前行业缺乏统一越狱分级标准,各家公司各说各话。如今四大AI公司达成共识,至少有了共同语言。

四项承诺:与政府的交易

作为恢复服务的条件,Anthropic向美国政府做出四项承诺:

  1. 发布前政府预访问:前沿模型发布前,指定政府合作伙伴获得扩展的早期评估权限。
  2. 快速信息共享:发现重大越狱或滥用模式时,快速通知政府,并共享新防护措施供独立测试。
  3. 专项联合研究资源:设立专门的Anthropic团队和算力,用于政府测试。
  4. 共同行业标准:推动前沿模型提供商之间共享安全评估标准。

本质上,这是一种交易:若想恢复服务,须允许政府在模型发布前先行审查。

这一做法可能令人不适,但可以理解。政策制定者面对一个能自主发现10000个安全漏洞的AI模型,难免紧张。

问题在于边界何在。本次“窄域越狱”即触发全球停服。未来,一个Category C的越狱就能导致数亿用户断服18天,这一响应级别是否合理?

对开发者的影响

以下是对日常使用Claude API或Claude Code的开发者的实际建议:

第一,重视Fable 5的误杀问题。 尤其在做安全相关开发,或提示中包含“解释推理过程”等指令时,需提前配置回退机制。官方提供三种方式:服务端fallbacks参数(最简单)、SDK中间件、手动重试。

第二,Sonnet 5可能是更务实的选择。 同一天发布的Sonnet 5,定价3/3/15,性能接近Opus 4.8,网络安全防护比Fable 5宽松得多。官方明确表示,“Sonnet 5的网络安全风险整体较低”,甚至无法生成Firefox漏洞利用代码(0.0%),因此无需极端分类器。

第三,长程Agent任务仍值得使用Fable 5。 官方文档强调:“看到最好结果的团队,是将Claude Fable 5用于最难的未解决问题。仅用简单任务测试,会严重低估其能力范围。”但需接受现实:在安全相关任务上,它可能降级。

第四,注意Thinking行为变化。 Fable 5的原始思维链永不返回,仅返回摘要或省略。用户无法关闭Thinking,低Effort设置下的表现仍“经常超过此前模型的xhigh”。这是优点,但意味着无法像以前一样调试模型的推理过程。

整体判断

结论:Fable 5回归是好事,但本次事件标志着AI治理进入新阶段——政府可因一个轻微越狱,就让全球最强AI模型停服18天。

技术判断: Fable 5确实是目前最强的公开发布模型,尤其在长程自主Agent和复杂编码场景中。但更严格的安全分类器使其实际可用性打了折扣,用户需为误杀做好准备。

行业判断: 本次事件设定了一个危险先例。亚马逊发现Category C越狱→政府全球叫停→18天后更严审查恢复,这一链条过短。若每次轻微越狱都走此流程,AI行业可能被监管拖累。好消息是,越狱分级框架的建立至少提供了讨论基础。

实践判断: 若不做安全相关开发,Fable 5仍是最佳选择。若从事安全开发,需认真配置回退,或考虑Sonnet 5作为替代。但无论选择哪个模型,都不应将其视为“永不中断”的基础设施——它已证明自己可能被叫停。

必须坦诚地说,对政府发布前预访问这一承诺是担忧的。一个商业AI模型发布前需经政府审查,在技术上如何实现?是否会演变为审批制?边界在哪里?这些问题尚未明确,但将是未来最值得关注的变量。

未来关注点

以下变量值得持续关注:

  1. 误杀率究竟多高? Anthropic称安全分类器触发率“低于5%的会话”,但新分类器表现如何,需待社区运行数周后验证。
  2. Mythos 5何时全球恢复? 目前仅限美国关键基础设施方使用,其他国家尚无时间表。
  3. 越狱分级框架能否真正落地? 四家公司提出框架,但执行标准和响应流程尚未细化。
  4. 中国开发者如何应对? 30天数据保留、不可选零数据保留,对国内合规意味着什么?
  5. Sonnet 5是否会成为实际首选? 性价比更高、限制更少,可能成为多数用户的“够用”之选。

18天内,一个模型经历了发布、封杀与回归。此事意义不在于Fable 5本身有多强,而在于它揭示了:当AI能力强到一定程度,其命运不再仅由技术决定。

参考资料

  • Claude Fable 5 and Claude Mythos 5 发布公告 - Anthropic 官方博客,2026.6.9
  • Statement on the US government directive to suspend access - Anthropic 官方声明,2026.6.12
  • Redeploying Fable 5 - Anthropic 官方博客,2026.6.30
  • @AnthropicAI 出口管制解除推文 - 84K likes, 13M views
  • @claudeai "Fable 5 is back." - 60K likes, 13秒视频
  • Howard Lutnick (商务部长) 关于解除管制的推文
  • Introducing Claude Fable 5 and Claude Mythos 5 官方文档
  • Refusals and Fallback 文档
  • Prompting Claude Fable 5 指南
  • Project Glasswing
  • Expanding Project Glasswing
  • HackerOne Anthropic Cyber Jailbreak 项目
  • 6月2日白宫行政令

侠游戏发布此文仅为了传递信息,不代表侠游戏网站认同其观点或证实其描述

热游推荐

更多
湘ICP备14008430号-1 湘公网安备 43070302000280号
All Rights Reserved
本站为非盈利网站,不接受任何广告。本站所有软件,都由网友
上传,如有侵犯你的版权,请发邮件给xiayx666@163.com
抵制不良色情、反动、暴力游戏。注意自我保护,谨防受骗上当。
适度游戏益脑,沉迷游戏伤身。合理安排时间,享受健康生活。