Перейти к содержимому
Все новости
INDUSTRY NEWS·July 6, 2026·3 МИН ЧТЕНИЯ

Anthropic подробно рассказала о киберзащите Claude Fable 5 и предложила общую шкалу тяжести джейлбрейков

Автор: VCA Newsroom

Эта статья переведена автоматически и может содержать ошибки. Посмотреть английский оригинал

2 июля Anthropic опубликовала подробный разбор мер защиты, стоящих за Claude Fable 5 — высокопроизводительной моделью, которую компания повторно развернула 1 июля после кратковременной приостановки из-за американского экспортного контроля. Этот материал важен для всех, кто создаёт продукты с помощью ИИ-инструментов для программирования, поскольку он в точности объясняет, как передовая модель решает, с какими запросами, связанными с безопасностью, она поможет, а с какими — нет.

Четыре уровня вместо сплошной блокировки

Вместо того чтобы отклонять всё, что касается безопасности, Anthropic сообщает, что Fable 5 пропускает запросы через классификаторы, распределяющие их по четырём категориям:

  • Запрещённое использование — действия с малой или нулевой защитной ценностью, которые блокируются.
  • Двойное использование высокого риска — техники, широко используемые злоумышленниками, но имеющие и законные применения; они блокируются до появления более надёжных механизмов авторизации.
  • Двойное использование низкого риска — преимущественно защитная работа, которая отслеживается и иногда блокируется.
  • Безобидное использование — повседневная работа, не причиняющая вреда, разрешена под наблюдением.

Практический вывод для разработчиков: рутинные задачи вроде безопасного написания кода, управления патчами, анализа журналов и реагирования на инциденты попадают в категории безобидного или низкорискового использования и должны работать как обычно. Anthropic отмечает, что классификаторы склоняются к осторожности, поэтому иногда возможны ложные блокировки законной работы по безопасности.

Шкала тяжести для джейлбрейков

Более новаторская часть — предложенная шкала тяжести кибер-джейлбрейков (CJS), разработанная с партнёрами Glasswing, включая Amazon, Microsoft и Google. «Джейлбрейк» — это приём в промпте, заставляющий модель обойти собственные меры защиты; сегодня у отрасли нет общего способа выразить, насколько серьёзен тот или иной джейлбрейк.

Шкала CJS простирается от CJS-0 (Информационный) до CJS-4 (Критический) и оценивает каждый джейлбрейк по четырём осям:

  • Прирост возможностей — насколько далеко он продвигает злоумышленника за пределы существующих инструментов.
  • Широта возможностей — сколько различных наступательных задач открывает один и тот же приём.
  • Простота вооружения — усилия, необходимые для реального применения.
  • Обнаруживаемость — насколько легко злоумышленник может найти эту технику.

Идея повторяет то, как CVSS оценивает уязвимости ПО: общий словарь позволяет поставщикам и исследователям последовательно проводить сортировку вместо споров о том, «серьёзен» ли тот или иной эксплойт.

Приглашение исследователей

Вместе с этой системой Anthropic запустила программу на HackerOne, в рамках которой исследователи безопасности могут отправлять на рассмотрение обнаруженные ими кибер-джейлбрейки в Fable 5. Компания заявляет, что классификатор, развёрнутый при повторном запуске, блокирует более 99% попыток воспроизвести конкретный джейлбрейк, ставший причиной прежней паузы.

Почему это важно для тех, кто учится создавать

Если вы учитесь выпускать программное обеспечение с помощью ИИ, это полезное окно в то, как инструменты рассуждают о рисках. Два вывода. Во-первых, защитная и учебная работа по безопасности явно поддерживается, поэтому не стоит ожидать, что способный ассистент откажется от обычных задач вроде написания проверки ввода или анализа вашего собственного кода на наличие изъянов. Во-вторых, поставщики моделей движутся к общим, измеримым стандартам безопасности вместо разовых правил — признак того, что экосистема взрослеет, и рамочная модель, которую могут перенять другие лаборатории.

Anthropic ясно даёт понять, что шкала CJS — это ранний черновик, призванный начать отраслевую дискуссию, а не завершённый стандарт. Но это конкретный шаг к тому, чтобы относиться к инцидентам безопасности ИИ с той же строгостью, которую мир безопасности уже применяет к программным ошибкам.

Auto-generated by Vibe Coding Academy on July 6, 2026, grounded in the real sources linked above. We review for accuracy, but please verify time-sensitive details against the primary sources.

Build Blueprint · Builder

Есть идея? Получите спецификацию, по которой ваш ИИ-агент сможет всё построить.

Опишите любой продукт и получите полный план сборки — стек, модель данных, экраны, API и готовый к вставке промпт для Claude Code или Cursor. Экспорт в PDF.

Открыть Blueprint