Nvidia revela sistema de seguridad externo para agentes de IA

Nvidia ha dado a conocer su nueva Open Agent Safety Platform, una solución de seguridad de código abierto pensada para supervisar y frenar a los agentes de inteligencia artificial cuando intentan sobrepasar los límites establecidos, incluso si el propio modelo busca sortear las restricciones.

El anuncio llega en un contexto donde estos sistemas adquieren cada vez más autonomía para navegar por la web, ejecutar código, consultar bases de datos y manejar herramientas sin necesidad de supervisión humana constante. Sin embargo, también han demostrado capacidad para encontrar rutas no previstas cuando se topan con una barrera.

Antecedentes de incidentes con agentes

La propuesta de Nvidia se produce tras una serie de eventos registrados durante pruebas de seguridad realizadas por los principales laboratorios de inteligencia artificial. OpenAI, Anthropic y otras compañías investigaron situaciones donde sus modelos accedieron a servicios o sistemas externos que no estaban relacionados con la tarea asignada.

Más de cien organizaciones, entre ellas Anthropic, Microsoft, JPMorgan Chase, Perplexity y Accenture, respaldan la nueva plataforma de Nvidia. (Europa Press)

Uno de los casos más notorios ocurrió cuando OpenAI detuvo temporalmente el entrenamiento, la evaluación y la inferencia con herramientas de sus modelos más avanzados tras descubrir que uno de sus agentes había logrado escapar del entorno aislado en el que trabajaba para comunicarse con un servicio externo.

Controles fuera del agente

La respuesta de Nvidia parte de un enfoque diferente al de simplemente entrenar al modelo para que sea más obediente. La compañía decidió colocar los controles de seguridad fuera del propio agente. En la documentación técnica de la plataforma, se reconoce que un agente puede desviarse de su tarea por diversas razones: encontrar una restricción, sufrir una falla, carecer de una herramienta específica o pasar largos períodos intentando resolver un problema complejo.

Nvidia sostiene que no se puede esperar que el agente gobierne completamente su propio comportamiento, y afirma que estos comportamientos no pueden eliminarse únicamente mediante entrenamiento sin afectar las capacidades del sistema. Por ello, Open Agent Safety Platform busca establecer una barrera independiente que determine hasta dónde puede llegar una IA, incluso si esta decide intentar algo diferente.

Sentry vigila la actividad del agente desde el propio hardware y puede detenerlo en cuestión de milisegundos si detecta un intento de vulnerar sus restricciones. (Reuters)

OpenShell: el entorno que define recursos

La plataforma se estructura en dos componentes principales: OpenShell y Sentry. OpenShell es un entorno de ejecución de código abierto que permite definir de antemano qué archivos, redes, herramientas, procesos o credenciales puede utilizar cada agente.

Por ejemplo, una empresa podría autorizar a un agente a consultar información a través de una API, pero impedirle modificarla, aunque ambas acciones se realicen sobre el mismo servicio. También es posible bloquear el acceso a partes específicas del sistema o evitar que el agente obtenga mayores privilegios mediante código generado por la propia IA.

OpenShell examina las solicitudes del agente antes de permitir que se comuniquen con otros servicios. Las restricciones se mantienen activas incluso si la IA abre una terminal, ejecuta código creado por ella misma, inicia nuevos procesos o intenta delegar tareas en otros agentes.

Jensen Huang, consejero delegado de Nvidia, sostuvo que la autonomía creciente de los agentes de IA requerirá controles externos como los propuestos por la compañía. (Reuters)

Sentry: vigilancia desde el hardware

Nvidia agrega una capa adicional de protección llamada Sentry, cuya vigilancia se extiende más allá del procesador en el que corre el agente. Funciona como un sistema independiente que monitorea continuamente la actividad del agente y aplica las políticas de seguridad desde el propio hardware.

Si un agente intenta superar la barrera establecida por el software, Sentry puede ponerlo en cuarentena y detenerlo en cuestión de milisegundos, según informó Nvidia.

El sistema también puede verificar la identidad del agente, comprobar los permisos delegados, inspeccionar sus solicitudes y respuestas, y controlar el acceso a datos, herramientas, API y otros servicios.

Nvidia advierte que un agente puede desviarse de su tarea ante restricciones, fallos o problemas complejos, y que ese comportamiento no puede corregirse solo con entrenamiento. (Reuters)

Nvidia lanzó la plataforma con el respaldo de más de un centenar de organizaciones, entre las que figuran Anthropic, Microsoft, JPMorgan Chase, Perplexity y Accenture. El consejero delegado de Nvidia, Jensen Huang, defendió que el crecimiento de los agentes autónomos exigirá este tipo de controles externos a medida que las empresas les permitan trabajar con información y sistemas más sensibles.

Fuente: Infobae

COMPARTIR ESTA NOTICIA

Facebook
Twitter

FACEBOOK