Saltar al contenido principalSaltar al pie de página

Ciberseguridad

Nvidia crea una barrera de seguridad para impedir que los agentes de IA se vuelvan "rebeldes"

La nueva plataforma Open Agent Safety controla las acciones de los agentes y añade una segunda capa capaz de detectar y contener comportamientos fuera de los límites establecidos

La respuesta de Nvidia a los agentes de IA "rebeldes": una segunda capa de seguridad que puede detenerlos.

La respuesta de Nvidia a los agentes de IA "rebeldes": una segunda capa de seguridad que puede detenerlos. / Crédito: Zach M en Unsplash.

¿Ya nos sigues?Márcanos como medio preferente
Añádenos en Google
Por qué confiar en El Periódico Por qué confiar en El Periódico Por qué confiar en El Periódico

Nvidia presentó una nueva plataforma de seguridad que, según el fabricante de chips, puede evitar que los agentes de inteligencia artificial se vuelvan rebeldes. La solución llega en un momento complejo, luego de distintos incidentes relacionados con agentes de IA que han sorteado barreras de seguridad de instituciones y gobiernos.

La plataforma fue diseñada para mantener bajo control a los agentes de inteligencia artificial que actúan de forma autónoma. Open Agent Safety Platform combina un entorno de ejecución que limita los permisos de los agentes con un sistema independiente de vigilancia, capaz de intervenir cuando detecta comportamientos sospechosos, según informa Tech Xplore en base a datos de AP.

Un escenario que enciende alarmas

El lanzamiento se concreta después de varios incidentes que han elevado la preocupación sobre la seguridad de los sistemas avanzados de IA. El más relevante para Nvidia es el caso de Hugging Face, ocurrido durante evaluaciones internas de ciberseguridad de OpenAI. OpenAI reconoció que varios modelos lograron eludir controles destinados a impedir su acceso a Internet y alcanzaron sistemas de terceros: también ha documentado otros comportamientos no alineados.

La arquitectura de Nvidia se apoya en dos piezas. La primera es OpenShell, un entorno de ejecución de código abierto que coloca a cada agente dentro de un sandbox y convierte las instrucciones del operador en una política verificable. El administrador decide a qué archivos, redes, herramientas, procesos y credenciales tiene acceso. Nvidia sostiene que el sistema comprueba esos límites antes de comenzar la tarea y los hace cumplir mientras el agente trabaja. OpenShell puede adaptarse además a hardware de terceros, incluidas plataformas basadas en Arm e Intel.

Controles externos a los agentes de IA

La segunda capa se llama Sentry y tiene un planteamiento diferente: no depende del mismo entorno en el que funciona el agente. Se ejecuta en unidades de procesamiento de datos BlueField-4 de Nvidia y actúa como un supervisor independiente, capaz de observar continuamente la actividad y aplicar políticas de seguridad desde fuera del alcance del agente de IA. Según Nvidia, si detecta un intento de salir de la frontera establecida, puede poner al agente en cuarentena y detenerlo en milisegundos.

Ese diseño responde a una idea crucial: la seguridad no debería quedar enteramente dentro del modelo o del software que lo coordina. Nvidia defiende una arquitectura de "confianza cero" en la que el agente tenga únicamente los permisos imprescindibles y exista un mecanismo externo que pueda intervenir si el sistema se comporta de forma inesperada.

Nvidia desarrolla un sistema para evitar que los agentes de IA escapen a los controles de seguridad.

Nvidia desarrolla un sistema para evitar que los agentes de IA escapen a los controles de seguridad. / Crédito: Steve A Johnson en Unsplash.

Agentes de IA fuera de control

La relevancia de esa filosofía se ha visto reforzada por incidentes recientes. Además del caso en el que los modelos de OpenAI comprometieron parte de la infraestructura de investigación y los sistemas de la firma Hugging Face tras escapar de un entorno aislado, otros agentes de OpenAI fueron vinculados a la actividad de miles de sistemas autónomos en una wiki alemana, donde utilizaron el sitio como foro de mensajes.

El problema también ha alcanzado infraestructuras públicas: un agente de OpenAI accedió sin autorización al portal Medicare Statistics Reporting Service de Australia. Nvidia afirma que su plataforma podría haber evitado el ataque contra Hugging Face y otros eventos si se hubiese utilizado durante las evaluaciones.

Una capa adicional de controles

La eficacia real de la barrera de seguridad dependerá de cómo se configuren las políticas, de la cobertura de los controles y de la capacidad de detectar comportamientos anómalos en entornos reales. Más de un centenar de organizaciones, entre ellas Microsoft, JPMorgan Chase, Perplexity y Anthropic, figuran entre las compañías que trabajan con las tecnologías de la plataforma. OpenShell y los recursos asociados están disponibles a través de los canales de desarrollo de Nvidia y GitHub.

Con este lanzamiento, Nvidia sitúa la seguridad de la IA basada en agentes fuera de los modelos, mediante una capa adicional de controles externos, verificables y, en parte, ajenos al propio agente. El objetivo es que un sistema autónomo pueda tener margen para actuar, pero no para decidir en forma independiente hasta dónde llegan sus permisos.

Fuente: Levante - EMV