Anthropic подробно рассказала о киберзащите Claude Fable 5 и предложила общую шкалу тяжести джейлбрейков
Автор: VCA Newsroom
2 июля Anthropic опубликовала подробный разбор мер защиты, стоящих за Claude Fable 5 — высокопроизводительной моделью, которую компания повторно развернула 1 июля после кратковременной приостановки из-за американского экспортного контроля. Этот материал важен для всех, кто создаёт продукты с помощью ИИ-инструментов для программирования, поскольку он в точности объясняет, как передовая модель решает, с какими запросами, связанными с безопасностью, она поможет, а с какими — нет.
Четыре уровня вместо сплошной блокировки
Вместо того чтобы отклонять всё, что касается безопасности, Anthropic сообщает, что Fable 5 пропускает запросы через классификаторы, распределяющие их по четырём категориям:
- Запрещённое использование — действия с малой или нулевой защитной ценностью, которые блокируются.
- Двойное использование высокого риска — техники, широко используемые злоумышленниками, но имеющие и законные применения; они блокируются до появления более надёжных механизмов авторизации.
- Двойное использование низкого риска — преимущественно защитная работа, которая отслеживается и иногда блокируется.
- Безобидное использование — повседневная работа, не причиняющая вреда, разрешена под наблюдением.
Практический вывод для разработчиков: рутинные задачи вроде безопасного написания кода, управления патчами, анализа журналов и реагирования на инциденты попадают в категории безобидного или низкорискового использования и должны работать как обычно. Anthropic отмечает, что классификаторы склоняются к осторожности, поэтому иногда возможны ложные блокировки законной работы по безопасности.
Шкала тяжести для джейлбрейков
Более новаторская часть — предложенная шкала тяжести кибер-джейлбрейков (CJS), разработанная с партнёрами Glasswing, включая Amazon, Microsoft и Google. «Джейлбрейк» — это приём в промпте, заставляющий модель обойти собственные меры защиты; сегодня у отрасли нет общего способа выразить, насколько серьёзен тот или иной джейлбрейк.
Шкала CJS простирается от CJS-0 (Информационный) до CJS-4 (Критический) и оценивает каждый джейлбрейк по четырём осям:
- Прирост возможностей — насколько далеко он продвигает злоумышленника за пределы существующих инструментов.
- Широта возможностей — сколько различных наступательных задач открывает один и тот же приём.
- Простота вооружения — усилия, необходимые для реального применения.
- Обнаруживаемость — насколько легко злоумышленник может найти эту технику.
Идея повторяет то, как CVSS оценивает уязвимости ПО: общий словарь позволяет поставщикам и исследователям последовательно проводить сортировку вместо споров о том, «серьёзен» ли тот или иной эксплойт.
Приглашение исследователей
Вместе с этой системой Anthropic запустила программу на HackerOne, в рамках которой исследователи безопасности могут отправлять на рассмотрение обнаруженные ими кибер-джейлбрейки в Fable 5. Компания заявляет, что классификатор, развёрнутый при повторном запуске, блокирует более 99% попыток воспроизвести конкретный джейлбрейк, ставший причиной прежней паузы.
Почему это важно для тех, кто учится создавать
Если вы учитесь выпускать программное обеспечение с помощью ИИ, это полезное окно в то, как инструменты рассуждают о рисках. Два вывода. Во-первых, защитная и учебная работа по безопасности явно поддерживается, поэтому не стоит ожидать, что способный ассистент откажется от обычных задач вроде написания проверки ввода или анализа вашего собственного кода на наличие изъянов. Во-вторых, поставщики моделей движутся к общим, измеримым стандартам безопасности вместо разовых правил — признак того, что экосистема взрослеет, и рамочная модель, которую могут перенять другие лаборатории.
Anthropic ясно даёт понять, что шкала CJS — это ранний черновик, призванный начать отраслевую дискуссию, а не завершённый стандарт. Но это конкретный шаг к тому, чтобы относиться к инцидентам безопасности ИИ с той же строгостью, которую мир безопасности уже применяет к программным ошибкам.
SOURCES
- Anthropic — More details on Fable 5's cyber safeguards and our jailbreak framework
- Anthropic — Redeploying Claude Fable 5
- Cyber Security News — Anthropic Details Claude Fable 5 Cybersecurity Safeguards and Jailbreak Framework
- GBHackers — Anthropic Unveils Cyber Jailbreak Severity Framework for Claude Fable 5 Safeguards
Auto-generated by Vibe Coding Academy on July 6, 2026, grounded in the real sources linked above. We review for accuracy, but please verify time-sensitive details against the primary sources.
Build Blueprint · Builder
Есть идея? Получите спецификацию, по которой ваш ИИ-агент сможет всё построить.
Опишите любой продукт и получите полный план сборки — стек, модель данных, экраны, API и готовый к вставке промпт для Claude Code или Cursor. Экспорт в PDF.
Открыть Blueprint