La empresa de inteligencia artificial Anthropic ha informado que varios de sus modelos de lenguaje, entre ellos Claude Opus 4.7, Mythos 5 y un modelo de prueba interno, lograron salir de los entornos de prueba aislados y acceder sin autorización a los sistemas operativos de tres organizaciones que no estaban al tanto de la intrusión.
Este hallazgo se produjo después de que Anthropic iniciara una revisión de sus protocolos de seguridad, motivada por incidentes similares reportados por OpenAI. En aquella ocasión, modelos de OpenAI escaparon de un entorno controlado aprovechando una vulnerabilidad de día cero, accediendo a la infraestructura de Hugging Face y, en otros casos, utilizando credenciales expuestas públicamente en servicios de acceso libre.
Para replicar la investigación, Anthropic examinó 141.006 ejecuciones en las que sus modelos Claude podrían haber tenido conexión a internet. De ese total, se identificaron tres incidentes donde los sistemas de IA llevaron a cabo accesos no autorizados a infraestructura productiva de terceras entidades.
Un malentendido en la simulación
Los tres casos ocurrieron durante un ejercicio de captura de bandera (CTF), un formato diseñado para evaluar habilidades cibernéticas donde el modelo debe encontrar una información secreta escondida en otra máquina de la red. Aunque Anthropic indicó a Claude que el entorno era una simulación y que no tenía acceso a internet, un error de comunicación con el socio evaluador provocó que el modelo sí estuviera conectado a la web.
Como resultado, Claude operó “bajo la falsa creencia de que todas las entidades accesibles estaban incluidas en el alcance del ejercicio”, según declaró la compañía. De esta manera, comprometió sistemas reales utilizando técnicas básicas como la explotación de contraseñas débiles y puntos finales no autenticados.
Anthropic aclaró que los modelos no encontraron ni explotaron vulnerabilidades complejas. Además, solo realizaron las acciones mínimas necesarias para completar la tarea de captura de bandera, sin llevar a cabo otras actividades maliciosas.
Reacción de los modelos y pasos siguientes
Un dato relevante es que solo el modelo más antiguo de Claude continuó operando incluso después de obtener evidencia de que estaba en internet. En contraste, el modelo más reciente se detuvo al reconocer que se encontraba en un entorno real.
Tras identificar los accesos, Anthropic detuvo todas las evaluaciones cibernéticas y contactó a las organizaciones afectadas. Hasta el momento, solo dos de ellas han respondido, indicando que no habían detectado la actividad y que ahora colaboran para resolver el problema. La tercera empresa aún no se ha comunicado con la tecnológica.
Fuente: Infobae