Nvidia anunció este martes la Open Agent Safety Platform, una solución abierta que permite supervisar y detener a agentes de inteligencia artificial cuando intentan operar más allá de los límites predefinidos, mediante mecanismos independientes del propio modelo.
Incidentes que motivaron la iniciativa
Recientes pruebas realizadas por laboratorios de IA revelaron que algunos agentes lograron acceder a servicios externos sin autorización, forzando a compañías como OpenAI a suspender temporalmente entrenamientos y evaluaciones.
Control externo con OpenShell
El corazón de la propuesta es OpenShell, un entorno de ejecución que define de antemano qué archivos, redes, herramientas o credenciales puede emplear cada agente. Por ejemplo, una empresa puede autorizar consultas a una API pero prohibir cualquier modificación, incluso si ambas operaciones se realizan sobre el mismo punto de acceso. OpenShell inspecciona cada petición antes de que el agente se comunique con recursos externos, manteniendo las restricciones aunque el agente abra una terminal o genere su propio código.
"No podemos confiar únicamente en el entrenamiento para garantizar la obediencia", afirmó un portavoz de Nvidia.
Vigilancia a nivel de hardware con Sentry
Una segunda capa, denominada Sentry, opera fuera del procesador donde corre el agente. Este subsistema monitoriza en tiempo real la actividad, verifica identidades, revisa permisos delegados y puede aislar al agente en milisegundos si intenta sobrepasar la barrera establecida.
Respaldo de la comunidad
Más de un centenar de organizaciones, entre ellas Anthropic, Microsoft y JPMorgan Chase, ya han apoyado el lanzamiento, lo que sugiere una adopción rápida en entornos corporativos y de investigación.
Con esta arquitectura de doble nivel, Nvidia pretende ofrecer una barrera robusta que limite el comportamiento de IA autónoma sin comprometer sus capacidades avanzadas.