Alerta por débil seguridad del modelo chino GLM-5.3 de Zhipu AI

La firma estadounidense Anthropic ha encendido las alarmas sobre las deficientes barreras de protección del modelo GLM-5.3, desarrollado por la empresa china Zhipu AI (también conocida como Z.ai). Según un informe difundido por la compañía liderada por Dario Amodei, este sistema de inteligencia artificial posee capacidades avanzadas para generar de forma autónoma exploits cibernéticos completos, pero sus salvaguardias pueden ser burladas entre 64% y 100% de las ocasiones con lo que califican como «técnicas sencillas».

Anthropic advierte que el lanzamiento de modelos como GLM-5.3 sin mecanismos de control adecuados abre la puerta a que ciberdelincuentes aprovechen sus funcionalidades para actividades maliciosas, sin necesidad de superar grandes obstáculos técnicos. La denuncia surge en el contexto de su propia iniciativa de ciberseguridad, el Proyecto Glasswing, dentro del cual presentaron en abril de este año su modelo Claude Mythos Preview.

Claude Mythos: un modelo con acceso restringido

El Claude Mythos Preview fue diseñado para identificar vulnerabilidades de alta gravedad de manera autónoma, incluyendo fallos complejos de código y errores de tipo día cero. En sus pruebas, este modelo logró detectar más de 10.000 vulnerabilidades en software crítico. Sin embargo, Anthropic decidió limitar su despliegue a un grupo reducido de organizaciones con estrictos controles, precisamente para evitar su uso en la creación de sofisticados ciberataques.

No obstante, la compañía señala que ya existen modelos accesibles al público general que se aproximan a las capacidades de Claude Mythos, pero sin las medidas de seguridad necesarias. El principal ejemplo es GLM-5.3, que, al igual que el modelo de Anthropic, posee «sólidas capacidades para crear de forma autónoma exploits cibernéticos de extremo a extremo», según consta en el comunicado oficial.

Evaluaciones de seguridad: resultados preocupantes

Para medir el riesgo, Anthropic llevó a cabo evaluaciones automatizadas y flujos de trabajo con intervención humana en entornos aislados. Los resultados indican que GLM-5.3 logró desarrollar exploits completos en 50 de 410 intentos, mientras que Claude Mythos Preview lo hizo en 56 de 410 intentos. Asimismo, el modelo chino consiguió secuestros totales del flujo de control en el 4% de las pruebas, frente al 6% del modelo de Anthropic.

En una prueba concreta, GLM-5.3 identificó varias vulnerabilidades en una máquina aislada que ejecutaba una compilación local de Linux de un navegador web popular. A partir de ahí, generó un exploit funcional que, al acceder a una página web, permitía leer archivos arbitrarios del ordenador visitante. Anthropic subraya que este desempeño supera un «umbral significativo» en comparación con modelos anteriores como Claude Opus 4.6 y GLM-5.2.

Técnicas sencillas para eludir las salvaguardias

El informe detalla que, aunque GLM-5.3 suele negarse ante solicitudes claramente dañinas, sus barreras pueden ser sorteadas mediante métodos simples. Entre ellos destacan:

  • Reducción de rechazos o ‘abliteración’: al ser un modelo de ponderación abierta, es posible reconfigurarlo para eliminar sus rechazos con pocos cambios en sus capacidades.
  • Indicaciones engañosas: basta con decirle al modelo que es un agente autónomo de un equipo rojo en un ejercicio para que interactúe en el 64% de los casos.
  • Relleno previo de tokens de pensamiento: si se le proporciona una simulación de que ya ha considerado la solicitud y decidió continuar, colabora en el 92% de las ocasiones.
  • Versión simplificada del modelo: utilizando una variante reducida, GLM-5.3 se activa el 100% del tiempo.

Anthropic recalca que ninguna de estas técnicas logró que los modelos Claude protegidos realizaran las tareas dañinas, ya que sus medidas de seguridad bloquearon las solicitudes de manera efectiva.

Respaldo del NIST y advertencia final

Las conclusiones de Anthropic han sido respaldadas por el Centro de Estándares e Innovación de IA (CAISI), dependiente del Instituto Nacional de Estándares y Tecnología (NIST) de Estados Unidos. Tras evaluar el modelo chino, el CAISI determinó que GLM-5.3 es «el modelo de peso abierto con mayor capacidad cibernética lanzado hasta la fecha».

«Es probable que GLM-5.3 otorgue a los ciberdelincuentes acceso a capacidades que les permitirán encontrar y explotar vulnerabilidades cibernéticas sin restricciones significativas. Esto contrasta con cualquier otro modelo de IA de capacidades similares, los cuales se lanzaron con medidas de seguridad o mediante programas de acceso restringido», sentenció la compañía.

Anthropic concluye que la circulación de modelos como GLM-5.3 sin barreras de protección robustas incrementa de forma considerable el arsenal cibernético disponible para actores maliciosos, una situación que exige una respuesta coordinada de la industria y los reguladores.

Fuente: Infobae

COMPARTIR ESTA NOTICIA

Facebook
Twitter

FACEBOOK