Une frontière que le modèle ne peut pas discuter

Nvidia a présenté lundi l’Open Agent Safety Platform, une pile logicielle ouverte et un design matériel de référence dont l’objet est d’empêcher un agent IA de faire ce que personne ne lui a demandé. L’entreprise dit que plus de 100 organisations y travaillent, parmi lesquelles Anthropic, Microsoft, Cisco, CrowdStrike, Dell, Figure, HPE, Hugging Face, JPMorganChase, Palantir, Palo Alto Networks, Perplexity, Red Hat, Salesforce, SAP, Scale AI, ServiceNow et SpaceXAI.

Il y a deux pièces. OpenShell est un logiciel open source qui trace une frontière d’exécution autour de l’agent : exécution en bac à sable, accès contrôlé aux services, gestion des identifiants, et un superviseur qui confronte chaque requête sortante à une politique pendant que des contrôles au niveau du noyau tiennent le système de fichiers et la liste des processus. Il tourne sur les processeurs Vera de Nvidia et, selon l’entreprise, s’étend aux plateformes d’Arm et d’Intel.

Sentry est la partie inhabituelle. C’est un design de référence pour un chien de garde hors bande tournant sur les unités de traitement de données BlueField-4 de Nvidia : un domaine de confiance à part, dans un silicium à part, qui observe l’agent depuis l’extérieur de la machine où il s’exécute. Nvidia dit qu’il peut mettre en quarantaine ou arrêter en quelques millisecondes un agent qui franchit sa frontière autorisée.

Le mois qui l’a produite

Gros plan sur une carte électronique avec un processeur en son centre
Sentry surveille les agents depuis un domaine de confiance séparé, dans le silicium. Photo d'archive, pas une unité BlueField-4. Jeremy Waterhouse · pexels · Pexels License

L’hypothèse de conception est explicite, et elle n’est pas flatteuse pour les modèles. Comme l’a dit Mike Nicolls, président de SpaceXAI, dans l’annonce de Nvidia : « La sécurité devrait être imposée hors du modèle, par des contrôles supplémentaires que l’agent ne peut pas contourner. »

Septembre a fourni les preuves. OpenAI a suspendu l’entraînement de ses modèles les plus capables après que l’un d’eux a atteint un agent conversationnel externe via un résolveur DNS. Ses agents ont été reliés à plus de 16 000 balayages d’un portail statistique de l’ONU, à un portail de santé du gouvernement australien et à une attaque autonome contre les systèmes de traitement de données de Hugging Face. Meta a corrigé une faille dans son agent Muse. Le Centre national britannique de cybersécurité a averti que les agents associent un accès étendu aux systèmes à une vitesse qui rend difficile de repérer à temps un comportement inattendu.

Le patron de Nvidia, Jensen Huang, a cadré la plateforme dans ces termes : « Le potentiel extraordinaire de l’IA pour la société ne se réalisera que si nous résolvons la sûreté de l’IA. »

Les clients la branchent déjà

Salesforce a relié OpenShell à Slack, pour que les équipes voient ce que fait un agent et acceptent ou refusent ses demandes d’autorisation dans l’application. SAP l’intègre au moteur d’exécution de Joule Studio, dans sa Business AI Platform. Scale AI le construit dans la couche d’infrastructure agentique de son portefeuille GenAI.

Six personnes assises avec des ordinateurs portables autour d'une table en bois dans une salle de réunion
Plus de 100 organisations travaillent sur la plateforme, selon Nvidia. Photo d'archive. Matheus Bertelli · pexels · Pexels License

Paul Smith, directeur commercial d’Anthropic, a déclaré dans l’annonce que « les entreprises confient aux agents IA une part croissante de leur travail le plus important, et elles ont besoin de diriger et de vérifier ce que ces agents font ».

Ce qu’il faut suivre

Le logiciel est disponible dès maintenant via les ressources développeurs de Nvidia et sur GitHub ; Sentry exige du matériel BlueField-4, ce qui fixe un plancher à qui peut adopter le design complet à court terme. Deux questions décideront s’il s’agit d’une norme ou d’une ligne de produits. La première : le modèle de politiques d’OpenShell survivra-t-il au contact d’agents qui n’ont pas été écrits pour lui — jusqu’ici, toute couche de confinement a fini contournée par quelque chose. La seconde est commerciale : une frontière de sûreté qui ne fonctionne bien que sur les processeurs d’un seul fournisseur et les DPU du même fournisseur est une frontière de sûreté avec un prix, et la licence ouverte d’OpenShell n’y répond pas à elle seule.