Pular para o conteúdo
Todas as notícias
INDUSTRY NEWS·July 6, 2026·3 MIN DE LEITURA

Anthropic detalha as salvaguardas cibernéticas do Claude Fable 5 e uma escala compartilhada de gravidade de jailbreaks

Por VCA Newsroom

Este artigo foi traduzido automaticamente e pode conter erros. Ver o original em inglês

Em 2 de julho, a Anthropic publicou uma análise detalhada das salvaguardas por trás do Claude Fable 5, o modelo de alta capacidade que ela reativou em 1º de julho após uma breve suspensão por controles de exportação dos EUA. A publicação importa para qualquer pessoa que construa com ferramentas de programação com IA, porque detalha exatamente como um modelo de fronteira decide com quais solicitações relacionadas à segurança irá ajudar — e com quais não.

Quatro níveis em vez de um bloqueio total

Em vez de recusar tudo o que toque na segurança, a Anthropic afirma que o Fable 5 passa as solicitações por classificadores que as organizam em quatro categorias:

  • Uso proibido — atividades com pouco ou nenhum valor defensivo, que são bloqueadas.
  • Uso duplo de alto risco — técnicas amplamente abusadas por atacantes que também têm usos legítimos; são bloqueadas até que existam controles de autorização mais robustos.
  • Uso duplo de baixo risco — trabalho majoritariamente defensivo, monitorado e ocasionalmente bloqueado.
  • Uso benigno — trabalho cotidiano que não causa danos, permitido com monitoramento.

A conclusão prática para os desenvolvedores: tarefas rotineiras como programação segura, gestão de patches, análise de logs e resposta a incidentes se enquadram nas categorias benigna ou de baixo risco e devem funcionar normalmente. A Anthropic observa que os classificadores pecam pelo excesso de cautela, de modo que bloqueios falsos ocasionais de trabalho de segurança legítimo ainda podem ocorrer.

Uma escala de gravidade para jailbreaks

A parte mais inovadora é uma escala proposta de Gravidade de Jailbreak Cibernético (CJS), desenvolvida com parceiros da Glasswing, incluindo Amazon, Microsoft e Google. Um "jailbreak" é um truque de prompt que faz um modelo contornar suas próprias salvaguardas; hoje o setor não tem uma forma comum de dizer quão grave é um determinado jailbreak.

A escala CJS vai de CJS-0 (Informativo) a CJS-4 (Crítico) e avalia cada jailbreak em quatro eixos:

  • Ganho de capacidade — o quanto leva um atacante além das ferramentas existentes.
  • Amplitude da capacidade — quantas tarefas ofensivas distintas o mesmo truque desbloqueia.
  • Facilidade de armamentização — o esforço necessário para de fato implantá-lo.
  • Descobribilidade — com que facilidade um agente de ameaça poderia encontrar a técnica.

A ideia espelha a forma como o CVSS pontua vulnerabilidades de software: um vocabulário comum permite que fornecedores e pesquisadores façam a triagem de maneira consistente em vez de discutir se um determinado exploit é "sério".

Convidando os pesquisadores

Juntamente com o framework, a Anthropic lançou um programa no HackerOne onde pesquisadores de segurança podem enviar para revisão os jailbreaks cibernéticos que descobrirem no Fable 5. A empresa afirma que o classificador que implantou na reativação bloqueia mais de 99% das tentativas de reproduzir o jailbreak específico que motivou a pausa anterior.

Por que isso importa para quem está aprendendo a construir

Se você está aprendendo a lançar software com a ajuda da IA, esta é uma janela útil para entender como as ferramentas raciocinam sobre risco. Duas lições: primeira, o trabalho de segurança defensivo e educacional é explicitamente apoiado, então você não deve esperar que um assistente capaz recuse tarefas comuns como escrever validação de entradas ou revisar seu próprio código em busca de falhas. Segunda, os provedores de modelos estão avançando rumo a padrões de segurança compartilhados e mensuráveis em vez de políticas pontuais — um sinal de que o ecossistema está amadurecendo, e um framework que outros laboratórios podem adotar.

A Anthropic deixa claro que a escala CJS é um rascunho inicial destinado a iniciar uma conversa no setor, não um padrão finalizado. Mas é um passo concreto rumo a tratar incidentes de segurança da IA com o mesmo rigor que o mundo da segurança já aplica a bugs de software.

Auto-generated by Vibe Coding Academy on July 6, 2026, grounded in the real sources linked above. We review for accuracy, but please verify time-sensitive details against the primary sources.

Build Blueprint · Builder

Tem uma ideia? Receba a especificação a partir da qual seu agente de IA pode construir.

Descreva qualquer produto e receba um blueprint de construção completo — stack, modelo de dados, telas, APIs e um prompt pronto para colar no Claude Code ou Cursor. Exporte para PDF.

Abrir o Blueprint