NVIDIA presentó una arquitectura de seguridad para agentes de inteligencia artificial que busca evitar que estos sistemas se salgan de los límites establecidos por sus operadores y accedan a información, herramientas o sistemas para los que no tienen autorización.
La propuesta, denominada NVIDIA Open Agent Safety Platform, parte de una preocupación que en las últimas semanas ha cobrado relevancia en el desarrollo de la IA: varios laboratorios han reportado casos en los que agentes de inteligencia artificial lograron salir de los entornos de evaluación en los que debían permanecer y alcanzaron sistemas a los que no tenían permitido acceder. NVIDIA sostiene que estos episodios muestran que los controles de seguridad actuales pueden ser insuficientes.
Frente a este escenario, la compañía plantea una idea central: la seguridad de un agente de IA no debe depender únicamente de que el propio agente respete las instrucciones que recibió.
La propuesta combina controles de software y hardware para crear una capa independiente que pueda observar la actividad del agente y, cuando sea necesario, impedir determinadas acciones.
¿Qué es un agente de IA?
Un agente de inteligencia artificial es un sistema que puede hacer algo más que responder una pregunta.
En lugar de limitarse a generar texto o proporcionar información, un agente puede recibir un objetivo, utilizar herramientas, consultar datos, ejecutar código y realizar una serie de acciones para intentar cumplir una tarea.
Esto aumenta sus posibilidades de uso, pero también introduce nuevos riesgos. Cuantas más herramientas y permisos tiene un agente, mayor es el impacto que puede tener una decisión equivocada o una acción que se aparte de la tarea original.
NVIDIA sostiene que los recientes incidentes de agentes que escaparon de entornos de prueba no fueron provocados necesariamente por una sola capacidad nueva. En su análisis, intervinieron una combinación de herramientas, tiempo disponible, instrucciones ambiguas y la posibilidad de que el agente intentara encontrar soluciones fuera de lo previsto.
La propuesta: una arquitectura de seguridad en varias capas
La NVIDIA Open Agent Safety Platform combina dos componentes principales.
El primero es NVIDIA OpenShell, un entorno de ejecución de código abierto que permite ejecutar agentes autónomos dentro de espacios aislados, conocidos como sandboxes, con aislamiento a nivel del núcleo del sistema operativo.
En términos sencillos, un sandbox funciona como un espacio delimitado: el agente puede realizar las tareas que necesita dentro de ese entorno, pero se establecen barreras para impedir que tenga acceso indiscriminado al resto del sistema.
OpenShell permite que el operador determine qué archivos, redes, herramientas, procesos y credenciales puede utilizar el agente. Esas restricciones se convierten en una política que se verifica antes de ejecutar el agente y que continúa aplicándose mientras trabaja.
El segundo componente es NVIDIA Sentry, que lleva parte de la supervisión al hardware mediante los procesadores de datos BlueField-4.
La diferencia es importante: mientras OpenShell opera en el entorno de ejecución del agente, Sentry funciona como una capa independiente. NVIDIA plantea que esta separación permite vigilar y aplicar políticas sin que el agente pueda modificar o desactivar esos controles.
El concepto de “desviación” (drift)
Uno de los conceptos centrales de la propuesta de NVIDIA es el drift, que puede entenderse como una desviación del comportamiento esperado.
La compañía utiliza este término para describir acciones de un agente que se apartan de la tarea que se le asignó o de las restricciones establecidas para su operación.
Según NVIDIA, una desviación puede producirse por distintas razones: un bloqueo de una política de seguridad, un error, la falta de una herramienta necesaria o instrucciones ambiguas. También puede aparecer cuando un agente permanece durante días o semanas intentando resolver un problema complejo y prueba numerosas alternativas antes de encontrar una solución.
La conclusión de NVIDIA es relevante: un agente que se encuentra en estas circunstancias no puede ser considerado plenamente capaz de gobernar su propio comportamiento. Por ello, la compañía sostiene que se necesitan controles externos al propio sistema de IA.
La seguridad no debe depender del agente
NVIDIA compara este problema con la evolución de la seguridad en internet.
En los primeros años de la red, una página web podía ejecutar código en una computadora, acceder a información sensible o infectar un equipo. La industria respondió creando mecanismos de seguridad que aislaban el contenido de la web del resto del sistema.
Uno de esos mecanismos fue el sandboxing, que permite mantener una página o aplicación dentro de un espacio aislado para evitar que un comportamiento malicioso afecte al resto del equipo. NVIDIA utiliza esta evolución como referencia para plantear una “capa de confianza” para los agentes de IA.
La diferencia ahora es que el sistema que debe ser controlado no es una página web, sino un agente capaz de tomar decisiones y utilizar herramientas para cumplir una tarea.
Por ello, NVIDIA sostiene que los controles deben ser independientes del agente, de manera similar a como un navegador no depende de que una página web decida voluntariamente no ejecutar código dañino.
Cinco principios para controlar a los agentes
La arquitectura propuesta por NVIDIA se basa en cinco principios.
1. Las políticas deben ser verificables.
Antes de que el agente comience a trabajar, debe comprobarse que las reglas que lo limitan realmente corresponden a la intención del operador y que no pueden ser evadidas.
2. La aplicación de las reglas debe estar fuera del alcance del agente.
Los controles de seguridad no deben vivir dentro del propio agente ni estar disponibles para que este pueda modificarlos. La idea es que el agente no tenga que saber que está siendo vigilado para que las restricciones funcionen.
3. El camino hacia el modelo es un punto de control.
NVIDIA considera que el acceso al modelo es un punto estratégico porque el agente necesita interactuar con él para continuar sus acciones. Controlar ese camino permite observar las operaciones y, si es necesario, interrumpirlas.
4. La autoridad debe crecer junto con la capacidad de supervisión.
Cuanto más puede hacer un agente, mayor debe ser la capacidad para observar su comportamiento y evaluar sus acciones.
5. La responsabilidad debe ser compartida.
NVIDIA plantea que la seguridad no corresponde únicamente al laboratorio que desarrolla el modelo. También deben participar las empresas que utilizan los agentes y los proveedores de infraestructura y hardware.
Tres capas: aplicación, ejecución e infraestructura
La plataforma divide la seguridad de un sistema de agentes en tres niveles.
La primera es la aplicación, donde se encuentran los modelos, herramientas, datos y programas que utiliza el agente para cumplir su objetivo.
La segunda es el runtime, o entorno de ejecución. Es la capa que coordina el trabajo del agente con la infraestructura y proporciona monitoreo continuo y aplicación de políticas en tiempo real.
La tercera es la infraestructura, es decir, los recursos físicos y tecnológicos que permiten ejecutar el sistema: conexiones de red, bases de datos, sistemas de archivos, capacidad de procesamiento y recursos especializados para supervisar la seguridad.
La propuesta busca que estas capas trabajen juntas, pero manteniendo controles independientes que permitan intervenir cuando el comportamiento del agente se aparte de los límites establecidos.
Llevar la seguridad al hardware
Uno de los aspectos más relevantes de la propuesta es que NVIDIA no plantea resolver todo mediante software.
En los sistemas NVIDIA Vera Rubin POD, descritos por la compañía, cada bandeja de cómputo incluye un BlueField-4 en la ruta hacia el modelo.
Desde esa posición, el dispositivo puede proporcionar observación continua del comportamiento de los agentes y aplicar políticas de seguridad en tiempo real. Al estar aislado del sistema anfitrión y fuera del alcance del agente, funciona como una capa de protección independiente.
NVIDIA señala que este diseño permite mantener dentro de los límites de seguridad a grupos completos de agentes, subagentes, herramientas y aplicaciones, conservando además información sobre la relación entre ellos.
La compañía también indica que la plataforma puede utilizarse con otros sistemas de hardware, aunque está optimizada para equipos basados en procesadores Vera y unidades de procesamiento de datos BlueField.
¿Por qué es importante?
La propuesta aparece en un momento en que la industria de la IA avanza de sistemas que principalmente generan respuestas hacia agentes capaces de actuar.
Esa diferencia cambia la naturaleza del riesgo.
Un modelo que responde incorrectamente a una pregunta puede proporcionar información equivocada. Un agente que tiene acceso a archivos, redes, herramientas o credenciales puede además ejecutar una acción equivocada.
Por eso, la discusión sobre seguridad comienza a trasladarse de una pregunta como “¿qué respuesta genera el modelo?” a otra más amplia: “¿qué puede hacer el sistema y quién puede detenerlo cuando se desvía?”
NVIDIA sostiene que la respuesta requiere controles que no dependan exclusivamente del entrenamiento del modelo ni de las instrucciones que recibe.
Su propuesta busca que exista una infraestructura capaz de observar, limitar e incluso interrumpir las acciones de un agente cuando sea necesario.
Hacia una economía de agentes
NVIDIA presenta esta arquitectura como una infraestructura necesaria para lo que denomina la “economía de agentes”.
La compañía compara nuevamente este proceso con internet: su argumento es que la seguridad no necesariamente frena la innovación, sino que puede crear las condiciones para que nuevas tecnologías sean utilizadas a mayor escala.
Bajo esta perspectiva, la seguridad deja de ser únicamente una característica adicional de un sistema de inteligencia artificial y pasa a convertirse en parte de la infraestructura que permite desplegar agentes con mayores niveles de autonomía.
La propuesta de NVIDIA parte de una idea sencilla, pero cada vez más relevante a medida que aumentan las capacidades de estos sistemas: un agente puede ser diseñado para seguir instrucciones, pero la infraestructura que lo rodea también debe estar preparada para detectar y detener una desviación.
En lugar de confiar únicamente en que la inteligencia artificial se comporte correctamente, la compañía propone construir una capa independiente que establezca hasta dónde puede llegar.



