Anthropic illustra le salvaguardie cyber di Claude Fable 5 e una scala condivisa di gravità per i jailbreak
Di VCA Newsroom
Il 2 luglio Anthropic ha pubblicato un'analisi dettagliata delle salvaguardie dietro Claude Fable 5, il modello ad alte capacità che ha riattivato il 1° luglio dopo una breve sospensione dovuta ai controlli statunitensi sulle esportazioni. Il post interessa chiunque costruisca con strumenti di programmazione basati sull'IA, perché spiega esattamente come un modello di frontiera decide quali richieste legate alla sicurezza accetterà di supportare — e quali no.
Quattro livelli anziché un blocco totale
Anziché rifiutare tutto ciò che tocca la sicurezza, Anthropic afferma che Fable 5 fa passare le richieste attraverso classificatori che le ordinano in quattro categorie:
- Uso vietato — attività con valore difensivo scarso o nullo, che vengono bloccate.
- Doppio uso ad alto rischio — tecniche ampiamente abusate dagli aggressori che hanno però anche usi legittimi; vengono bloccate in attesa di controlli di autorizzazione più solidi.
- Doppio uso a basso rischio — lavoro perlopiù difensivo, monitorato e occasionalmente bloccato.
- Uso benigno — lavoro quotidiano che non causa danni, consentito con monitoraggio.
La conclusione pratica per gli sviluppatori: le attività di routine come la programmazione sicura, la gestione delle patch, l'analisi dei log e la risposta agli incidenti rientrano nelle categorie benigna o a basso rischio e dovrebbero funzionare normalmente. Anthropic osserva che i classificatori peccano per eccesso di prudenza, quindi occasionali blocchi errati di lavoro di sicurezza legittimo possono comunque verificarsi.
Una scala di gravità per i jailbreak
La parte più innovativa è una proposta di scala di Gravità dei Jailbreak Cyber (CJS), sviluppata con i partner di Glasswing tra cui Amazon, Microsoft e Google. Un «jailbreak» è un trucco nel prompt che induce un modello ad aggirare le proprie salvaguardie; oggi il settore non dispone di un modo condiviso per esprimere quanto sia grave un determinato jailbreak.
La scala CJS va da CJS-0 (Informativo) a CJS-4 (Critico) e valuta ogni jailbreak lungo quattro assi:
- Guadagno di capacità — quanto porta un aggressore oltre gli strumenti esistenti.
- Ampiezza della capacità — quanti compiti offensivi distinti lo stesso trucco sblocca.
- Facilità di weaponization — lo sforzo necessario per distribuirlo effettivamente.
- Reperibilità — con quanta facilità un attore delle minacce potrebbe trovare la tecnica.
L'idea rispecchia il modo in cui CVSS valuta le vulnerabilità software: un vocabolario comune consente a fornitori e ricercatori di effettuare il triage in modo coerente invece di discutere se un dato exploit sia «serio».
Invitare i ricercatori
Parallelamente al framework, Anthropic ha lanciato un programma HackerOne in cui i ricercatori di sicurezza possono inviare per la revisione i jailbreak cyber che scoprono in Fable 5. L'azienda afferma che il classificatore distribuito al momento della riattivazione blocca oltre il 99% dei tentativi di riprodurre lo specifico jailbreak che aveva provocato la precedente pausa.
Perché è importante per chi impara a costruire
Se stai imparando a rilasciare software con l'aiuto dell'IA, questa è una finestra utile sul modo in cui gli strumenti ragionano sul rischio. Due spunti: primo, il lavoro di sicurezza difensivo ed educativo è esplicitamente supportato, quindi non dovresti aspettarti che un assistente capace rifiuti compiti ordinari come scrivere la validazione degli input o rivedere il tuo codice alla ricerca di difetti. Secondo, i fornitori di modelli si stanno orientando verso standard di sicurezza condivisi e misurabili anziché politiche una tantum — segno che l'ecosistema sta maturando, e un framework che altri laboratori potrebbero adottare.
Anthropic è chiara: la scala CJS è una bozza iniziale pensata per avviare una conversazione nel settore, non uno standard definitivo. Ma è un passo concreto verso il trattamento degli incidenti di sicurezza dell'IA con lo stesso rigore che il mondo della sicurezza applica già ai bug del software.
SOURCES
- Anthropic — More details on Fable 5's cyber safeguards and our jailbreak framework
- Anthropic — Redeploying Claude Fable 5
- Cyber Security News — Anthropic Details Claude Fable 5 Cybersecurity Safeguards and Jailbreak Framework
- GBHackers — Anthropic Unveils Cyber Jailbreak Severity Framework for Claude Fable 5 Safeguards
Auto-generated by Vibe Coding Academy on July 6, 2026, grounded in the real sources linked above. We review for accuracy, but please verify time-sensitive details against the primary sources.
Build Blueprint · Builder
Hai un'idea? Ottieni le specifiche da cui il tuo agente IA può partire.
Descrivi qualsiasi prodotto e ottieni un blueprint di sviluppo completo — stack, modello dati, schermate, API e un prompt pronto da incollare per Claude Code o Cursor. Esporta in PDF.
Apri il Blueprint