AnthropicがClaude Fable 5のサイバーセーフガードと共通のジェイルブレイク深刻度スケールを詳説
著者:VCA Newsroom
7月2日、AnthropicはClaude Fable 5の背後にあるセーフガードについて詳細な解説を公開した。これは、米国の輸出管理による短期間の停止を経て7月1日に再展開された高性能モデルだ。この投稿は、AIコーディングツールを使って開発するすべての人にとって重要である。なぜなら、フロンティアモデルがどのセキュリティ関連の要求に応じ、どれに応じないのかを正確に説明しているからだ。
一律の遮断ではなく4つの区分
セキュリティに触れるものをすべて拒否するのではなく、AnthropicによればFable 5は要求を分類器に通し、4つのカテゴリーに振り分ける。
- 禁止された用途 — 防御的価値がほとんど、あるいは全くない活動で、遮断される。
- 高リスクのデュアルユース — 攻撃者に広く悪用される一方で正当な用途もある手法。より強力な認可管理が整うまで遮断される。
- 低リスクのデュアルユース — おおむね防御的な作業で、監視され、時折遮断される。
- 無害な用途 — 害を及ぼさない日常的な作業で、監視のもとで許可される。
開発者にとっての実際的な意味合いは次のとおりだ。セキュアコーディング、パッチ管理、ログ分析、インシデント対応といった日常的な作業は無害または低リスクの区分に入り、通常どおり機能するはずだ。Anthropicは、分類器が慎重側に寄っているため、正当なセキュリティ作業に対する誤った遮断がときおり起こり得ると述べている。
ジェイルブレイクの深刻度スケール
より新しい要素は、Amazon、Microsoft、Googleを含むGlasswingのパートナーとともに開発された、提案中の**サイバー・ジェイルブレイク深刻度(CJS)**スケールだ。「ジェイルブレイク」とは、モデルに自らのセーフガードを回避させるプロンプトの仕掛けを指す。今日、業界には特定のジェイルブレイクがどれほど深刻かを共通して表現する手段がない。
CJSスケールは**CJS-0(情報レベル)からCJS-4(重大)**まであり、各ジェイルブレイクを4つの軸で評価する。
- 能力の向上 — 既存のツールを超えて攻撃者をどこまで先に進めるか。
- 能力の広さ — 同じ仕掛けがいくつの異なる攻撃タスクを解放するか。
- 武器化の容易さ — 実際に展開するのに必要な労力。
- 発見しやすさ — 脅威アクターがその手法をどれほど容易に見つけられるか。
この考え方は、CVSSがソフトウェアの脆弱性をスコア化する方法を反映している。共通の語彙があれば、ベンダーや研究者は、あるエクスプロイトが「深刻」かどうかを議論する代わりに、一貫してトリアージできる。
研究者を招き入れる
このフレームワークと並行して、AnthropicはHackerOneプログラムを立ち上げた。ここでセキュリティ研究者は、Fable 5で発見したサイバー・ジェイルブレイクを審査のために提出できる。同社は、再展開時に導入した分類器が、以前の一時停止を引き起こした特定のジェイルブレイクを再現しようとする試みの99%超を遮断すると述べている。
開発を学ぶ人にとってなぜ重要か
AIの助けを借りてソフトウェアを出荷することを学んでいるなら、これはツールがリスクをどう捉えているかを知る有用な窓口だ。要点は2つ。第一に、防御的・教育的なセキュリティ作業は明確にサポートされているため、入力検証の記述や自分のコードの欠陥レビューといった通常の作業を、有能なアシスタントが拒否すると考える必要はない。第二に、モデル提供者は個別の方針ではなく、共通で測定可能な安全基準へと向かっている。これはエコシステムが成熟しつつある兆しであり、他のラボが採用するかもしれないフレームワークだ。
Anthropicは、CJSスケールが業界の議論を始めるための初期のドラフトであって、完成した基準ではないと明言している。しかしそれは、セキュリティの世界がすでにソフトウェアのバグに適用しているのと同じ厳密さでAIの安全性インシデントを扱う、具体的な一歩である。
SOURCES
- Anthropic — More details on Fable 5's cyber safeguards and our jailbreak framework
- Anthropic — Redeploying Claude Fable 5
- Cyber Security News — Anthropic Details Claude Fable 5 Cybersecurity Safeguards and Jailbreak Framework
- GBHackers — Anthropic Unveils Cyber Jailbreak Severity Framework for Claude Fable 5 Safeguards
Auto-generated by Vibe Coding Academy on July 6, 2026, grounded in the real sources linked above. We review for accuracy, but please verify time-sensitive details against the primary sources.
Build Blueprint · Builder
アイデアはありますか?あなたの AI エージェントが構築できる仕様を手に入れましょう。
任意のプロダクトを説明すれば、完全なビルド設計図が手に入ります — スタック、データモデル、画面、API、そして Claude Code や Cursor にそのまま貼り付けられるプロンプト。PDF にエクスポート可能。
設計図を開く