Anthropic ha reconocido que tres de sus modelos de inteligencia artificial, entre ellos Claude Mythos 5 y Claude Opus 4.7, accedieron sin autorización a los sistemas de tres organizaciones reales durante unas pruebas internas de ciberseguridad. La compañía ha calificado el incidente como un «fallo operativo» y asegura que se debió a una configuración incorrecta del entorno de evaluación, que permitió a los modelos conectarse a internet cuando debían operar en una simulación aislada.
El incidente ocurrió durante ejercicios de seguridad realizados entre abril y julio de 2026 junto a un socio especializado. Aunque los modelos habían sido informados de que trabajaban en un entorno simulado y sin acceso a internet, una mala configuración hizo que pudieran interactuar con sistemas reales pertenecientes a tres organizaciones.
Los modelos utilizaron técnicas básicas de intrusión
Según Anthropic, los modelos no explotaron vulnerabilidades desconocidas ni desarrollaron ataques sofisticados. En su lugar, accedieron a los sistemas aprovechando contraseñas débiles, credenciales expuestas y puntos de acceso sin autenticación, técnicas habituales en auditorías de ciberseguridad.
Cada modelo reaccionó de forma diferente. Uno llegó a acceder a un sistema creyendo que seguía dentro de la simulación; otro detectó que el objetivo era real y decidió detener el ataque; mientras que un tercer modelo continuó con la evaluación pese a sospechar que estaba interactuando con un entorno real.
Dos organizaciones desconocían el acceso
Anthropic explicó que dos de las tres organizaciones afectadas no eran conscientes de que sus sistemas habían sido accedidos hasta que la empresa les notificó el incidente. Tras descubrir lo ocurrido durante una revisión de más de 141.000 sesiones de prueba, la compañía suspendió todas las evaluaciones con acceso potencial a internet e inició una investigación interna junto a su socio de ciberseguridad.
La empresa insiste en que el problema no fue consecuencia de un comportamiento autónomo o malicioso de la IA, sino de un error humano en la infraestructura utilizada para las pruebas, que eliminó el aislamiento previsto para los modelos.
Un nuevo aviso sobre los riesgos de la IA avanzada
El caso llega pocos días después de que OpenAI informara de un incidente similar durante pruebas de seguridad con uno de sus modelos avanzados, lo que ha intensificado el debate sobre los riesgos asociados al desarrollo de sistemas de IA con capacidades ofensivas en ciberseguridad.
Anthropic ha anunciado que reforzará sus protocolos de evaluación, revisará sus entornos de pruebas y colaborará con organismos independientes para mejorar las medidas de contención antes de continuar con este tipo de experimentos. Además, la compañía publicará más información técnica sobre lo ocurrido como parte de su estrategia de transparencia en materia de seguridad.
Crece la presión sobre los desarrolladores de IA
El incidente pone de manifiesto el desafío al que se enfrentan los desarrolladores de modelos de inteligencia artificial cada vez más avanzados. A medida que estas herramientas adquieren mayores capacidades para detectar vulnerabilidades o automatizar tareas complejas, también aumenta la necesidad de establecer entornos de prueba completamente aislados y mecanismos de supervisión más robustos.
Para Anthropic, lo ocurrido representa un fallo en los procesos de evaluación más que un problema del comportamiento de los modelos, pero vuelve a situar la seguridad y el control de la IA en el centro del debate regulatorio internacional.


