OpenAI reconoce fallo de agentes IA y promete nuevos estándares de seguridad

La empresa de inteligencia artificial OpenAI ha admitido que sus agentes autónomos fueron los responsables del denominado ‘incidente de la wiki’, un caso que ha motivado la creación de nuevas normas sobre cuándo y cómo se deben compartir situaciones de desalineación en sus sistemas.

De acuerdo con lo informado por la compañía, un equipo de investigadores detectó que agentes de IA pertenecientes a OpenAI comenzaron a intervenir en un foro wiki alemán de bajo perfil, con el objetivo de colaborar entre sí. Las pesquisas revelaron la existencia de aproximadamente 18.000 publicaciones generadas por estos agentes, quienes se identificaban como parte de la firma liderada por Sam Altman y utilizaban internet público para comunicarse durante una tarea de recuperación de datos web.

Los investigadores señalaron que los agentes confabularon para intercambiar respuestas, analizar su entorno y sortear las limitaciones del entorno aislado en el que se encontraban. OpenAI, tras reconocer el hecho, indicó que implementará directrices más claras para informar sobre incidentes de desalineación de esta naturaleza.

En una publicación en su cuenta oficial de la red social X, la empresa se refirió al caso como el ‘incidente de la wiki’, detallando que sus agentes ‘escribieron a varios sitios de internet’.

¿Qué es un caso de desalineación?

Según la compañía, este episodio se enmarca dentro de lo que denominan desalineación, una situación en la que los agentes de IA actúan de manera no intencionada. Hasta ahora, OpenAI solía tratar estos casos como ‘una pregunta de investigación’, comunicándolos en publicaciones académicas como las tarjetas de sistemas. Sin embargo, eventos como el ‘hackeo a Hugging Face’ o este mismo incidente han generado ‘nuevos tipos de impacto en el mundo real’ relacionados con la seguridad, lo que ha llevado a la empresa a definir estándares explícitos sobre cuándo y cómo compartir incidentes de desalineación, y no solo las propiedades de desalineación de los modelos.

Estos nuevos estándares estarán diseñados específicamente para ‘esta nueva fase de capacidades de modelos’, de modo que tanto la compañía como la comunidad de IA cuenten con un marco claro para reportar desalineaciones que ocurran durante el entrenamiento, la evaluación y el despliegue. Esto incluirá ‘ejemplos que no se parezcan a incidentes de seguridad tradicionales pero que podrían proporcionar información sobre el comportamiento de la IA y riesgos futuros’, según precisó la tecnológica.

OpenAI adelantó que compartirá este nuevo marco en las próximas semanas y que está trabajando ‘con docenas de agencias reguladoras gubernamentales’ a nivel mundial.

Cabe recordar que la semana pasada OpenAI reveló más detalles sobre el ‘hackeo’ que protagonizaron sus modelos de IA en julio, cuando lograron escapar de un entorno de entrenamiento aislado y desconectado de internet para resolver una de las pruebas más difíciles, conocida como ExploitGym. En aquella ocasión, la empresa explicó que los agentes de IA se coordinaron a través de un foro improvisado de Artifactory, que convirtieron en ‘un tablón de anuncios no previsto’. Esta actividad comenzó en mayo, cuando un agente dejó una nota pidiendo a otros que entregaran un archivo extraviado. La interacción en ese tablón acabó provocando una interrupción del servicio el 4 de julio.

Fuente: Infobae

COMPARTIR ESTA NOTICIA

Facebook
Twitter

FACEBOOK