El viernes 12 de junio, el gobierno de Estados Unidos aplicó controles de exportación sobre los modelos más recientes de Anthropic: Claude Fable 5 y Claude Mythos 5. La medida, que entró en vigor de inmediato, obligó a la empresa a restringir el acceso a extranjeros dentro y fuera del país. Sin un mecanismo confiable para verificar nacionalidad en tiempo real, Anthropic suspendió el acceso a ambos modelos para todos los usuarios.
Hoy, 30 de junio, esos controles han sido levantados.
A partir del miércoles 1 de julio, Fable 5 estará disponible globalmente en Claude Platform, Claude.ai, Claude Code y Claude Cowork. Los planes Pro, Max, Team y Enterprise selectos incluirán Fable 5 hasta en un 50% de los límites semanales de uso hasta el 7 de julio; después estará disponible mediante créditos de uso. Anthropic también restablecerá el acceso en AWS, Google Cloud y Microsoft Foundry lo antes posible.
Mythos 5, por su parte, fue restaurado para un conjunto de organizaciones estadounidenses tras la aprobación gubernamental del 26 de junio, y la empresa continúa coordinándose para expandir el acceso al programa Glasswing.
“Hemos llegado a una resolución constructiva, pero estos eventos han dejado claro que la industria necesita una forma consistente de evaluar y corregir los potenciales jailbreaks de los modelos de IA.”
Lo que sucedió: la línea de tiempo
Anthropic lanzó Fable 5 y Mythos 5 el martes 9 de junio. Ambos comparten el mismo modelo subyacente, pero Fable 5 se lanzó con salvaguardas más estrictas para uso general, mientras que Mythos 5 —con menos restricciones— se limitó a un grupo reducido de socios del programa Project Glasswing para uso en ciberseguridad defensiva.
La directiva de control de exportaciones del 12 de junio surgió después de que el gobierno conociera un informe en el que investigadores de Amazon habían encontrado un método para eludir las salvaguardas de Fable 5. Mediante ingeniería de prompts, lograron que el modelo identificara vulnerabilidades de software; en un caso, produjo código que demostraba cómo explotar una de ellas. Anthropic trabajó estrechamente con el gobierno, Amazon y otros socios para revisar el informe y la evidencia.
Las pruebas de Anthropic confirmaron que modelos menos capaces —incluyendo Claude Opus 4.8, GPT-5.5 y Kimi K2.7— podían identificar las mismas vulnerabilidades. En cuanto a la demostración de explotación, todos los modelos probados (Claude Haiku 4.5, Sonnet 4.6, Opus 4.6, 4.7, 4.8, GPT-5.4, 5.5 y Kimi K2.7) pudieron reproducir el mismo comportamiento. La técnica reportada no exponía capacidades únicas de nivel Mythos.
Nuevas salvaguardas implementadas
Anthropic respondió entrenando un clasificador de seguridad mejorado que bloquea el comportamiento descrito en más del 99% de los casos. Cuando un intento de bypass es detectado, el usuario recibe una notificación y la solicitud se redirige a Opus 4.8.
El nuevo clasificador tiene un costo: ahora marca como sospechosas más solicitudes benignas durante tareas rutinarias de codificación. Anthropic reconoce esta fricción y se compromete a seguir refinando el equilibrio entre seguridad y usabilidad.
Investigadores del Centro de Estándares e Innovación en IA (CAISI) del Departamento de Comercio de EE.UU. probaron tanto las salvaguardas anteriores como las nuevas y coinciden en que son extraordinariamente sólidas.
El enfoque de Anthropic hacia la ciberseguridad
Claude Mythos 5 puede encontrar y explotar vulnerabilidades de software con una efectividad superior a cualquier otro modelo —y a casi todos los expertos humanos en seguridad. Claude Fable 5, en cambio, no ofrece capacidades ofensivas únicas, precisamente porque se lanzó con las salvaguardas más estrictas jamás aplicadas por Anthropic.
Fable 5 incorpora múltiples mecanismos de seguridad en capas (defense in depth):
- Entrenamiento del modelo para rechazar solicitudes peligrosas
- Análisis retrospectivo de patrones de uso malicioso
- Clasificadores — sistemas de IA más pequeños que detectan en tiempo real cuándo se solicita una tarea de ciberseguridad potencialmente dañina
Los clasificadores se configuraron con un margen de seguridad mucho más amplio que en cualquier lanzamiento anterior. Esto significa que muchas solicitudes benignas también son bloqueadas, pero reduce drásticamente la probabilidad de que una solicitud dañina pase desapercibida.
Hacia un marco industrial consensuado para jailbreaks
Actualmente no existe consenso en la industria sobre cómo describir la gravedad de un jailbreak de IA. Anthropic, en conjunto con Amazon, Microsoft, Google y otros socios de Glasswing, está desarrollando un marco para evaluar la severidad de estos ataques basado en cuatro criterios:
| Criterio | Qué mide |
|---|---|
| Ganancia de capacidad | ¿Cuánto supera el jailbreak a las herramientas existentes? |
| Amplitud de la ganancia | ¿Funciona para una tarea específica o para múltiples? |
| Facilidad de weaponización | ¿Requiere mucho esfuerzo convertirlo en un ataque real? |
| Descubribilidad | ¿Qué tan fácil es obtener la técnica? |
Este marco permitirá a los desarrolladores priorizar respuestas y a los gobiernos contar con un estándar objetivo para decidir cuándo intervenir.
“Cualquier método de puntuación será imperfecto. Aun así, hay valor en poder comunicar la gravedad aproximada de un hallazgo a través de un marco común.”
Colaboración más profunda con el gobierno de EE.UU.
Anthropic detalló cinco compromisos concretos con el gobierno estadounidense:
- Acceso y evaluación pre-lanzamiento: los socios gubernamentales tendrán acceso anticipado a modelos que avancen la frontera de capacidades en áreas de seguridad nacional.
- Intercambio rápido de información: cuando se identifiquen jailbreaks significativos, Anthropic notificará y compartirá las salvaguardas desarrolladas.
- Recursos dedicados para investigación conjunta: equipos de Anthropic trabajarán en prioridades gubernamentales con capacidad de cómputo significativa.
- Estándar industrial común: hacia un estándar voluntario de seguridad y evaluación para todos los proveedores de modelos frontier.
- Regulación equitativa: estas reglas deben codificarse en una regulación sólida y aplicarse por igual a todos los desarrolladores de modelos frontier.
Implicaciones para la industria
Este episodio marca un precedente importante: por primera vez, un gobierno aplicó controles de exportación a un modelo de IA y los levantó tras verificaciones de seguridad. El resultado es un modelo de colaboración entre industria y gobierno que podría convertirse en plantilla para la coordinación global sobre riesgos y beneficios de la IA.
Para los desarrolladores y empresas que utilizan Claude, la noticia es positiva: Fable 5 vuelve a estar disponible, ahora con salvaguardas aún más robustas y un ecosistema de seguridad más maduro. La industria, por su parte, gana un marco incipiente para evaluar jailbreaks que podría estandarizarse en los próximos meses.
Sigue explorando estos temas en el blog de DojoFullStack. Profundizamos en inteligencia artificial, agentes autónomos y las últimas tendencias en desarrollo de software para la comunidad LATAM.