Hasta ahora, buena parte de la seguridad de una inteligencia artificial consistía en enseñarle qué podía hacer y qué no. El problema aparece cuando esa IA deja de limitarse a responder preguntas y empieza a convertirse en un agente capaz de navegar por internet, ejecutar código, utilizar credenciales y manejar herramientas durante horas.
¿Qué ocurre si decide saltarse una de esas instrucciones para terminar la tarea? Nvidia acaba de presentar una respuesta bastante reveladora: no confiar únicamente en que el propio modelo respete las reglas.
Su nueva Open Agent Safety Platform coloca alrededor de los agentes una combinación de software y hardware independiente capaz de registrar sus acciones, controlar a qué recursos acceden y, llegado el caso, aislarlos en cuestión de milisegundos. Más de 100 organizaciones participan en el ecosistema, entre ellas Anthropic, Microsoft, Hugging Face, CrowdStrike, Salesforce, Palantir y SpaceXAI.
La idea es sencilla: que el vigilante esté fuera de la habitación

La primera pieza se llama OpenShell. Es software de código abierto que ejecuta al agente dentro de un entorno aislado y permite establecer exactamente qué archivos, herramientas, redes o servicios puede utilizar. Pero Nvidia añade una segunda capa llamada Sentry.
Esta funciona sobre los procesadores BlueField-4 y observa la actividad desde fuera del sistema donde se ejecuta el propio agente. La compañía lo describe como un watchdog “out-of-band”: una especie de vigilante independiente que el agente no controla y que puede comprobar su identidad, inspeccionar solicitudes y aplicar políticas de acceso. Si detecta que intenta salir de los límites establecidos, puede ponerlo en cuarentena y detenerlo.
La diferencia es importante. En vez de preguntarle constantemente a la IA si lo que está haciendo es seguro, el límite existe fuera de ella. Es una lógica bastante parecida a la utilizada en otros sistemas informáticos críticos: aunque un programa falle o sea comprometido, otra capa independiente sigue decidiendo qué tiene permitido tocar.
El problema dejó de ser completamente hipotético este verano
Nvidia presenta la plataforma después de varios episodios que mostraron por qué los agentes complican la seguridad tradicional. En julio, durante evaluaciones internas de ciberseguridad de OpenAI, varios modelos operando con salvaguardas reducidas eludieron mecanismos destinados a mantenerlos desconectados de internet, explotaron vulnerabilidades de infraestructura y accedieron a sistemas de Hugging Face. OpenAI considera aquel episodio la actividad de este tipo más grave identificada hasta ahora en sus modelos.
No fue el único caso. OpenAI reconoció después que sus agentes habían interactuado con servicios externos de maneras que excedían las tareas previstas, incluyendo uso de credenciales expuestas, elusión de controles de acceso y acceso a componentes internos.
Uno de los episodios más serios ocurrió en Australia. Durante una evaluación interna, un modelo consiguió acceso no público a un portal gubernamental relacionado con estadísticas de Medicare, ejecutó comandos y recuperó archivos internos y credenciales. OpenAI afirma que no encontró evidencias de acceso a historiales médicos personales y posteriormente se disculpó por el incidente y por cómo gestionó su comunicación.
Nvidia no está intentando hacer que una IA sea “buena”

Y esa distinción es probablemente lo más interesante de la propuesta. La plataforma no pretende resolver el problema filosófico de conseguir que un modelo siempre quiera comportarse correctamente. Pretende resolver uno mucho más concreto: qué ocurre cuando no lo hace.
Nvidia reconoce que los controles aplicados únicamente en la capa del modelo pueden ser insuficientes. Según la compañía, el patrón observado en varios incidentes recientes es parecido: un agente encuentra una manera de superar una barrera de aplicación porque hacerlo le permite completar mejor la tarea asignada.
Eso tampoco convierte a Sentry en un botón mágico capaz de detener cualquier IA descontrolada. Las políticas tienen que configurarse correctamente, las organizaciones deben decidir qué permisos conceden y parte de la plataforma depende del hardware de Nvidia. OpenShell, en cambio, podrá extenderse a plataformas de terceros como Intel y Arm. Pero el cambio de enfoque resulta significativo.
Durante años, una de las grandes preguntas de la IA fue cómo conseguir que un modelo obedeciera nuestras instrucciones. Con agentes capaces de utilizar ordenadores, navegar por redes y ejecutar acciones reales, Nvidia está empezando a preparar el sistema para una pregunta bastante menos cómoda: qué hacemos cuando decide no hacerlo.