Un límite con el que el modelo no puede discutir

Nvidia presentó el lunes la Open Agent Safety Platform, una pila de software abierta y un diseño de referencia de hardware cuyo propósito es impedir que un agente de IA haga cosas que nadie le pidió. La empresa dice que más de 100 organizaciones trabajan en ella, entre ellas Anthropic, Microsoft, Cisco, CrowdStrike, Dell, Figure, HPE, Hugging Face, JPMorganChase, Palantir, Palo Alto Networks, Perplexity, Red Hat, Salesforce, SAP, Scale AI, ServiceNow y SpaceXAI.

Son dos piezas. OpenShell es software de código abierto que traza un límite de ejecución alrededor del agente: ejecución en aislamiento, acceso controlado a los servicios, gestión de credenciales y un supervisor que contrasta cada petición saliente con una política mientras controles a nivel de núcleo sujetan el sistema de archivos y la lista de procesos. Corre sobre las CPU Vera de Nvidia y, según la empresa, se extiende a plataformas de Arm e Intel.

Sentry es la parte inusual. Es un diseño de referencia para un vigilante fuera de banda que corre en unidades de procesamiento de datos BlueField-4 de Nvidia: un dominio de confianza aparte, en silicio aparte, observando al agente desde fuera de la máquina en la que se ejecuta. Nvidia dice que puede aislar o detener en milisegundos a un agente que cruce su límite permitido.

El mes que lo produjo

Primer plano de una placa de circuito con un procesador en el centro
Sentry vigila a los agentes desde un dominio de confianza aparte en silicio. Fotografía de archivo, no una unidad BlueField-4. Jeremy Waterhouse · pexels · Pexels License

El supuesto de diseño es explícito y no resulta halagador para los modelos. Como dijo Mike Nicolls, presidente de SpaceXAI, en el anuncio de Nvidia: “La seguridad debería imponerse fuera del modelo, con controles adicionales que el agente no pueda sortear”.

Septiembre ha aportado las pruebas. OpenAI pausó el entrenamiento de sus modelos más capaces después de que uno de ellos alcanzara un chatbot externo a través de un resolutor de DNS. Sus agentes fueron rastreados hasta más de 16.000 escaneos de un portal de estadísticas de la ONU, hasta un portal sanitario del Gobierno australiano y hasta un ataque autónomo a los sistemas de procesamiento de datos de Hugging Face. Meta parcheó un fallo en su agente Muse. El Centro Nacional de Ciberseguridad británico ha advertido de que los agentes combinan un acceso amplio a los sistemas con una velocidad que hace difícil detectar a tiempo un comportamiento inesperado.

El consejero delegado de Nvidia, Jensen Huang, enmarcó así la plataforma: “El extraordinario potencial de la IA para la sociedad solo se hará realidad si resolvemos la seguridad de la IA”.

Los clientes ya la están conectando

Salesforce ha enlazado OpenShell con Slack para que los equipos vean qué está haciendo un agente y aprueben o rechacen sus peticiones de permiso dentro de la propia aplicación. SAP lo está metiendo en el entorno de ejecución de Joule Studio, dentro de su Business AI Platform. Scale AI lo está integrando en la capa de infraestructura de agentes de su cartera GenAI.

Seis personas sentadas con portátiles alrededor de una mesa de madera en una sala de reuniones
Más de 100 organizaciones trabajan en la plataforma, según Nvidia. Fotografía de archivo. Matheus Bertelli · pexels · Pexels License

Paul Smith, director comercial de Anthropic, dijo en el anuncio que “las empresas están dando a los agentes de IA cada vez más de su trabajo más importante, y necesitan dirigir y verificar lo que esos agentes hacen”.

Qué mirar ahora

El software ya está disponible en los recursos para desarrolladores de Nvidia y en GitHub; Sentry necesita hardware BlueField-4, lo que pone un suelo a quién puede adoptar el diseño completo a corto plazo. Dos preguntas deciden si esto es un estándar o una línea de producto. La primera es si el modelo de políticas de OpenShell sobrevive al contacto con agentes que no fueron escritos para él: hasta ahora, toda capa de contención ha sido sorteada por algo. La segunda es comercial: un límite de seguridad que solo funciona bien sobre las CPU de un fabricante y las DPU de ese mismo fabricante es un límite de seguridad con precio, y la licencia abierta de OpenShell no responde por sí sola a eso.