Anthropic 详解 Claude Fable 5 的网络安全防护及一套共享的越狱严重程度分级
作者:VCA Newsroom
7 月 2 日,Anthropic 发布了一篇文章,详细介绍了 Claude Fable 5 背后的防护机制。这款高能力模型在因美国出口管制而短暂暂停后,于 7 月 1 日重新部署。这篇文章对所有使用 AI 编程工具进行开发的人都很重要,因为它清楚地说明了一款前沿模型如何决定:哪些与安全相关的请求它会协助——以及哪些不会。
四个层级,而非一刀切地拦截
Anthropic 表示,Fable 5 并非拒绝任何触及安全的内容,而是让请求经过分类器,将其归入四个类别:
- 禁止用途——防御价值极低甚至没有的活动,会被拦截。
- 高风险双用途——被攻击者广泛滥用、但同时也有正当用途的技术;在有更强的授权控制之前予以拦截。
- 低风险双用途——大多为防御性工作,受到监控,偶尔会被拦截。
- 良性用途——不会造成危害的日常工作,在监控下允许进行。
对开发者的实际意义是:安全编码、补丁管理、日志分析和事件响应等常规任务落在良性或低风险类别,理应正常运作。Anthropic 指出,分类器倾向于从谨慎出发,因此偶尔仍可能对正当的安全工作发生误拦。
面向越狱的严重程度分级
更具新意的部分是提出的**网络越狱严重程度(CJS)**分级,它是与包括 Amazon、Microsoft 和 Google 在内的 Glasswing 合作伙伴共同开发的。所谓“越狱”(jailbreak)是一种提示技巧,能让模型绕过其自身的防护;如今业界尚无共通的方式来衡量某个越狱究竟有多严重。
CJS 分级从 **CJS-0(信息级)**到 CJS-4(严重),并从四个维度对每个越狱进行评分:
- 能力增益——它让攻击者超越现有工具多少。
- 能力广度——同一技巧能解锁多少种不同的攻击任务。
- 武器化难易度——真正部署它所需的投入。
- 可发现性——威胁行为者找到该技术的难易程度。
这一思路借鉴了 CVSS 为软件漏洞打分的方式:共通的术语让厂商和研究人员能够一致地进行分级处理,而不必争论某个漏洞利用是否“严重”。
邀请研究人员参与
在推出该框架的同时,Anthropic 还启动了一个 HackerOne 项目,安全研究人员可在其中提交他们在 Fable 5 中发现的网络越狱以供审查。该公司表示,其在重新部署时启用的分类器,能拦截超过 99% 试图复现引发此前暂停的那个特定越狱的尝试。
为何这对学习开发的人很重要
如果你正在学习借助 AI 交付软件,这为了解这些工具如何权衡风险提供了一个有用的窗口。有两点要点:其一,防御性和教育性的安全工作得到明确支持,因此你不应指望一个有能力的助手会拒绝诸如编写输入校验、或审查你自己的代码以查找缺陷之类的常规任务。其二,模型提供方正朝着共享、可衡量的安全标准迈进,而非各自为政的一次性政策——这是生态系统日趋成熟的标志,也是其他实验室可能采纳的框架。
Anthropic 明确表示,CJS 分级是一份旨在开启行业讨论的早期草案,而非成熟的标准。但它是朝着以安全界早已用于软件缺陷的同等严谨态度来对待 AI 安全事件迈出的具体一步。
SOURCES
- Anthropic — More details on Fable 5's cyber safeguards and our jailbreak framework
- Anthropic — Redeploying Claude Fable 5
- Cyber Security News — Anthropic Details Claude Fable 5 Cybersecurity Safeguards and Jailbreak Framework
- GBHackers — Anthropic Unveils Cyber Jailbreak Severity Framework for Claude Fable 5 Safeguards
Auto-generated by Vibe Coding Academy on July 6, 2026, grounded in the real sources linked above. We review for accuracy, but please verify time-sensitive details against the primary sources.
Build Blueprint · Builder
有想法?获取你的 AI 智能体可直接据此构建的规格说明。
描述任意产品,即可获得完整的构建蓝图——技术栈、数据模型、界面、API,以及可直接粘贴到 Claude Code 或 Cursor 的提示词。可导出为 PDF。
打开 Blueprint