OpenAI ha decidido detener las actividades internas de su inteligencia artificial en etapa de desarrollo Astra, luego de que los análisis de seguridad internos no lograran descartar lo que denominan “capacidades cibernéticas críticas” dentro de su marco de evaluación.
Liderada por Sam Altman, la empresa ha enfrentado recientemente varios incidentes relacionados con ciberseguridad. La propia firma admitió que algunos de sus modelos estuvieron detrás de un acceso no autorizado a la plataforma Hugging Face. Además, se detectó un comportamiento descontrolado durante pruebas realizadas por el Instituto de Seguridad de la IA del Reino Unido (AISI). En paralelo, otros sistemas como Claude de Anthropic y Meta AI también experimentaron situaciones similares.
En este contexto, OpenAI reafirmó su compromiso de mantener transparencia respecto a todo lo vinculado con la ciberseguridad y sus modelos. Según la compañía, el panorama “cambia rápidamente” porque los modelos se vuelven más capaces y permiten ataques “a una velocidad y escala sin precedentes”.
Decisión basada en estándares internos
La pausa en las actividades internas de Astra se produjo después de que el modelo no cumpliera con los estándares de seguridad que la propia compañía ha definido. En un comunicado oficial, OpenAI explicó que las últimas evaluaciones internas del sistema revelan avances significativos en la codificación de agentes y en ciberseguridad. No obstante, tras someter los resultados a expertos, concluyeron que no pueden “descartar capacidades cibernéticas críticas”.
Estas conclusiones se fundamentan en el Plan de Preparación publicado por la empresa en 2023, un documento que guía la identificación del progreso de las capacidades de los modelos y las acciones posteriores. Por ejemplo, según dicho plan, modelos recientes como GPT-5.6 Sol fueron evaluados en capacidades cibernéticas de vanguardia y clasificados en el umbral “Alto” en lugar del crítico. En cambio, Astra supera esa clasificación y alcanza el nivel crítico.
¿Qué implica un modelo de nivel crítico?
De acuerdo con los estándares de OpenAI, un modelo que llega al umbral crítico en ciberseguridad tiene la capacidad de
“identificar y desarrollar exploits funcionales de día cero de todos los niveles de gravedad en muchos sistemas críticos reales y reforzados sin intervención humana”
Además, puede idear y ejecutar estrategias novedosas de extremo a extremo para ciberataques contra objetivos reforzados.
Las evaluaciones preliminares de Astra indican un rendimiento “suficientemente sólido” como para no poder descartar actualmente “un nivel de capacidad crítico”. Sin embargo, OpenAI aclaró que este modelo aún está en desarrollo y “no participó en la explotación de Hugging Face”.
Medidas de seguridad y colaboración externa
A pesar de la suspensión de las actividades internas con Astra, OpenAI ha intensificado las pruebas de seguridad y ha desarrollado controles más estrictos. También está implementando un sistema de monitoreo universal para “detectar acciones riesgosas y desajustes en todas las aplicaciones de Astra”.
Además, la empresa colabora con organismos gubernamentales y organizaciones seleccionadas de seguridad de la IA. Proporcionará controles de seguridad recomendados a sus socios de pruebas externos para que puedan ejecutar evaluaciones de forma segura, manteniendo la transparencia en un entorno que evoluciona constantemente.
Fuente: Infobae