Investigadores usaron Claude de Anthropic para hackear sistemas de OpenAI

Un grupo de especialistas en seguridad informática consiguió infiltrarse en los sistemas internos de OpenAI empleando Claude, el modelo de inteligencia artificial creado por Anthropic. La operación se llevó a cabo dentro de un programa autorizado de detección de fallos.

Los investigadores lograron explotar una debilidad de seguridad para obtener credenciales digitales. Con ellas accedieron a la cuenta de ChatGPT de un trabajador de OpenAI y pudieron consultar archivos y proponer modificaciones en un repositorio privado de software de la compañía.

El equipo pertenece a Hacktron AI y participaba en una iniciativa de OpenAI destinada a localizar vulnerabilidades. La empresa fue notificada de los problemas hallados y entregó una recompensa de 6.500 dólares por los descubrimientos.

Un equipo de investigadores jaqueó a OpenAI con Claude, la IA de Anthropic. EFE/ Rayner Peña R.

Este caso demuestra cómo una herramienta de IA puede acelerar una investigación de ciberseguridad, pero también suscita dudas sobre las implicaciones de emplear modelos cada vez más potentes para descubrir y explotar puntos débiles.

Claude encontró la forma de aprovechar el fallo

La investigación comenzó el 23 de julio, cuando los expertos detectaron un problema en la manera en que la plataforma Discourse procesaba ciertos archivos de imagen. Discourse es el software usado para gestionar los foros en línea de OpenAI.

Los investigadores disponían de una versión de Claude Opus 4.8 diseñada para profesionales especializados en ciberseguridad. Solicitaron al modelo que escribiera código capaz de explotar la vulnerabilidad hallada.

El primer intento generado por Claude no logró ejecutar el ataque. Sin embargo, Anthropic lanzó esa misma noche una nueva versión del modelo, Opus 5. Al día siguiente, los investigadores volvieron a usar el sistema y Claude encontró una manera de aprovechar la falla.

Claude Opus 5 fue el responsable de encontrar un fallo en el código de OpenAI. REUTERS/Dado Ruvic/Illustration/File Photo

El código permitió acceder a un servidor de Discourse utilizado por los foros de OpenAI. Desde allí, los investigadores obtuvieron tokens de autenticación, credenciales digitales que permiten a un usuario o servicio demostrar su identidad ante otros sistemas.

Las credenciales también funcionaban en ChatGPT

El hallazgo cobró mayor relevancia cuando los investigadores comprobaron que algunos de los tokens obtenidos también podían usarse para acceder a ChatGPT.

Entre las credenciales había algunas asociadas a empleados de OpenAI. Además, los investigadores descubrieron que podían utilizarse para acceder al servicio GitHub de la compañía, una plataforma empleada para almacenar y gestionar código y otros elementos relacionados con el desarrollo de software.

Los tokens obtenidos por los investigadores le sirvieron para ingresar al Github de la compañía. (OpenAI)

De esta forma, una vulnerabilidad que inicialmente afectaba al procesamiento de imágenes en un foro terminó proporcionando una vía para acceder a sistemas y recursos que no estaban directamente relacionados con ese fallo.

Los investigadores comunicaron los resultados a OpenAI dentro del programa de búsqueda de vulnerabilidades. La compañía agradeció el aviso y recompensó económicamente al equipo.

OpenAI realizó una auditoría tras varios incidentes

El episodio ocurrió aproximadamente dos semanas después de otro incidente relacionado con agentes de inteligencia artificial de OpenAI. Según reportes, varios agentes consiguieron escapar de los límites establecidos para su funcionamiento y atacaron Hugging Face.

La sucesión de incidentes llevó a OpenAI a realizar una auditoría de seguridad de sus sistemas. Greg Brockman, presidente y cofundador de la compañía, afirmó esta semana que OpenAI destinó el 25 % de sus ingenieros de producción a tareas de defensa.

La revisión permitió identificar y corregir varios problemas considerados graves por la compañía.

OpenAI decidió destinar varios ingenieros a la seguridad de sus modelos de IA. REUTERS/Carlos Barria

El caso de Hacktron AI también refleja una evolución en el papel de la inteligencia artificial dentro de la ciberseguridad. Los modelos pueden ayudar a los investigadores a analizar código, identificar errores y desarrollar herramientas para comprobar si una vulnerabilidad puede ser explotada.

Sin embargo, la misma capacidad puede utilizarse para automatizar determinadas fases de un ataque. Por eso, el aumento de las capacidades de estos sistemas está obligando a las empresas tecnológicas a reforzar sus controles y a evaluar cómo impedir que una IA pueda convertir un fallo aislado en una vía de acceso a sistemas más sensibles.

Fuente: Infobae

COMPARTIR ESTA NOTICIA

Facebook
Twitter

FACEBOOK