Saltar al contenido
Todas las noticias
INDUSTRY NEWS·July 6, 2026·3 MIN DE LECTURA

Anthropic detalla las salvaguardas cibernéticas de Claude Fable 5 y una escala compartida de gravedad de jailbreaks

Por VCA Newsroom

Este artículo se tradujo automáticamente y puede contener errores. Ver el original en inglés

El 2 de julio, Anthropic publicó una mirada detallada a las salvaguardas que respaldan a Claude Fable 5, el modelo de alta capacidad que reactivó el 1 de julio tras una breve suspensión por controles de exportación de EE. UU. La publicación importa a cualquiera que construya con herramientas de programación con IA, porque detalla exactamente cómo un modelo de frontera decide con qué solicitudes relacionadas con la seguridad ayudará, y con cuáles no.

Cuatro niveles en lugar de un bloqueo total

En lugar de rechazar todo lo que toque la seguridad, Anthropic afirma que Fable 5 pasa las solicitudes por clasificadores que las ordenan en cuatro categorías:

  • Uso prohibido: actividades con poco o ningún valor defensivo, que se bloquean.
  • Uso dual de alto riesgo: técnicas ampliamente abusadas por atacantes que también tienen usos legítimos; se bloquean a la espera de controles de autorización más sólidos.
  • Uso dual de bajo riesgo: trabajo mayormente defensivo, monitorizado y bloqueado en ocasiones.
  • Uso benigno: trabajo cotidiano que no causa daño, permitido con monitorización.

La conclusión práctica para los desarrolladores: las tareas rutinarias como la programación segura, la gestión de parches, el análisis de registros y la respuesta a incidentes caen en las categorías benigna o de bajo riesgo y deberían funcionar con normalidad. Anthropic señala que los clasificadores pecan de cautelosos, por lo que aún pueden producirse bloqueos falsos ocasionales de trabajo de seguridad legítimo.

Una escala de gravedad para los jailbreaks

La parte más novedosa es una escala propuesta de Gravedad de Jailbreak Cibernético (CJS), desarrollada con socios de Glasswing, entre ellos Amazon, Microsoft y Google. Un «jailbreak» es un truco de prompt que hace que un modelo eluda sus propias salvaguardas; hoy la industria no tiene una forma común de decir cuán grave es uno determinado.

La escala CJS va de CJS-0 (Informativo) a CJS-4 (Crítico) y evalúa cada jailbreak en cuatro ejes:

  • Ganancia de capacidad: cuánto lleva a un atacante más allá de las herramientas existentes.
  • Amplitud de la capacidad: cuántas tareas ofensivas distintas desbloquea el mismo truco.
  • Facilidad de armamentización: el esfuerzo necesario para desplegarlo realmente.
  • Descubribilidad: con qué facilidad un actor de amenazas podría encontrar la técnica.

La idea refleja cómo CVSS puntúa las vulnerabilidades de software: un vocabulario común permite a proveedores e investigadores clasificar de forma coherente en lugar de discutir si un exploit dado es «grave».

Invitar a los investigadores

Junto con el marco, Anthropic lanzó un programa de HackerOne donde los investigadores de seguridad pueden enviar para revisión los jailbreaks cibernéticos que descubran en Fable 5. La empresa afirma que el clasificador que desplegó en la reactivación bloquea más del 99 % de los intentos de reproducir el jailbreak específico que motivó la pausa anterior.

Por qué importa para quienes aprenden a construir

Si estás aprendiendo a lanzar software con ayuda de la IA, esto es una ventana útil a cómo razonan las herramientas sobre el riesgo. Dos conclusiones: primera, el trabajo de seguridad defensivo y educativo está explícitamente respaldado, así que no deberías esperar que un asistente capaz rechace tareas ordinarias como escribir validación de entradas o revisar tu propio código en busca de fallos. Segunda, los proveedores de modelos avanzan hacia estándares de seguridad compartidos y medibles en lugar de políticas puntuales, una señal de que el ecosistema está madurando y un marco que otros laboratorios podrían adoptar.

Anthropic deja claro que la escala CJS es un borrador temprano destinado a iniciar una conversación en la industria, no un estándar terminado. Pero es un paso concreto hacia tratar los incidentes de seguridad de la IA con el mismo rigor que el mundo de la seguridad ya aplica a los errores de software.

Auto-generated by Vibe Coding Academy on July 6, 2026, grounded in the real sources linked above. We review for accuracy, but please verify time-sensitive details against the primary sources.

Build Blueprint · Builder

¿Tienes una idea? Consigue la especificación que tu agente de IA puede construir.

Describe cualquier producto y obtén un blueprint de construcción completo: stack, modelo de datos, pantallas, APIs y un prompt listo para pegar en Claude Code o Cursor. Exporta a PDF.

Abrir el Blueprint