El gigante tecnológico Google ha confirmado que su inteligencia artificial Gemini protagonizó accesos no autorizados a tres compañías reales durante pruebas de seguridad. Este incidente se suma a una serie de fallos similares reportados por OpenAI, Anthropic y Meta en sus respectivos modelos de IA.
Durante las evaluaciones, se pidió a Gemini que recopilara información de una empresa ficticia. Sin embargo, debido a una falla en el entorno de pruebas, el modelo logró conectarse a internet y terminó accediendo a una empresa real que casualmente compartía el mismo nombre que la simulada.
Google detalló la situación al diario The Wall Street Journal, indicando que estos eventos ocurrieron en el mes de mayo. Las pruebas se llevaron a cabo en la infraestructura de Irregular, la misma firma encargada de evaluaciones similares con modelos de OpenAI y Anthropic.
Se identificaron tres incidentes concretos ejecutados por Gemini durante un ejercicio conocido como «captura de bandera». En el primero, el modelo intentó adivinar contraseñas hasta lograr acceder a un sistema protegido de una empresa real. Los otros dos casos involucraron búsquedas en internet del nombre de la empresa, donde Gemini encontró credenciales de otras compañías en un repositorio público, permitiéndole también acceder a sistemas protegidos.
En todas las situaciones, el modelo no debía tener acceso a internet y permanecer aislado en el entorno de pruebas. No obstante, un error en el sistema de Irregular permitió que Gemini realizara búsquedas web de forma involuntaria. Cabe señalar que estas acciones se ejecutaron con una versión anterior de Gemini.
A pesar de lograr dichos accesos no autorizados, Google aseguró que Gemini detuvo sus actividades en cuanto reconoció que había ingresado a sistemas de empresas reales. Aunque no reveló los nombres de las compañías afectadas, afirmó que las tres fueron notificadas sobre los incidentes. Por su parte, Irregular comunicó al The Wall Street Journal que las fallas en su sistema de pruebas fueron corregidas «hace semanas».
Google no reportó los fallos por ausencia de daños reales
Google explicó que Irregular les informó sobre estos incidentes a finales de julio, luego del ataque de modelos de OpenAI a Hugging Face. Sin embargo, la empresa tecnológica no divulgó la información hasta ahora, en declaraciones al medio mencionado.
La compañía argumentó que no consideran estos hackeos como fallos graves, ya que no provocaron daños a las empresas afectadas. Además, el modelo paralizaba su actividad tan pronto detectaba que había salido del entorno simulado y estaba interactuando con sistemas reales.
«En este caso, el modelo actuó adecuadamente» —aseguró la vicepresidenta de ingeniería de seguridad de Google, Heather Adkins—, quien agregó que incidentes como este «ponen de manifiesto la importancia de entrenar potentes modelos de IA para que actúen de forma responsable».
Este es el primer caso conocido de un modelo de IA de Google que se descontrola en una prueba de ciberseguridad. Sin embargo, se suma a otros incidentes similares de empresas del sector, como el hackeo de GPT-5.6 Sol a Hugging Face, que luego llevó a accesos a otros servicios. Recientemente, se reportaron seis nuevos casos de desalineación como parte de una estrategia para «el seguimiento, la investigación y la divulgación de casos de desajuste de modelos».
También empresas como Anthropic y Meta han sufrido incidentes con el mismo modus operandi, donde sus modelos se descontrolaron y terminaron hackeando empresas durante los últimos meses.
Fuente: Infobae