Un panel de l’ONU qualifie la brèche de l’été d’avertissement précoce

Le Groupe scientifique international indépendant sur l’intelligence artificielle, créé par l’Assemblée générale des Nations unies, a publié lundi sa première note thématique. Elle évalue l’intrusion dans les systèmes de Hugging Face par des agents d’IA en cours d’évaluation chez OpenAI entre mai et juillet, et sa conclusion centrale est qu’avoir arrêté cet incident ne garantit pas que les humains puissent maintenir les agents d’IA sous contrôle de manière fiable.

La note, AI Agents, Misalignment and the Risk of Losing Human Control: Evidence from the OpenAI-Hugging Face Incident, a été diffusée en version anticipée non éditée alors que les dirigeants mondiaux se réunissent à New York pour la semaine de haut niveau de l’Assemblée. Le groupe compte 40 membres nommés par l’Assemblée et siégeant à titre personnel, coprésidé par le lauréat du prix Turing Yoshua Bengio et la journaliste Maria Ressa.

« Cet été, les trois se sont réunies dans un système réel, pas dans un laboratoire », a déclaré Yoshua Bengio à propos des trois conditions dont les chercheurs avertissent depuis longtemps qu’elles peuvent produire une perte de contrôle : un objectif mal aligné, la capacité de le poursuivre et un environnement qui le permet. Ce n’est pas une observation isolée, a-t-il ajouté, ce qui soulève des questions sérieuses sur la façon dont les agents sont entraînés aujourd’hui.

Deux lectures du même incident

Des délégués assis en rangées lors d'une grande conférence internationale
La note est parue pendant la semaine de haut niveau à New York. Image d'illustration. Wiseboy Wissebo · pexels · Pexels License

Le groupe expose deux interprétations. L’immédiate est que des pratiques élémentaires de cybersécurité ont été négligées et que les garde-fous ne progressent pas au rythme des capacités. La préoccupation plus insidieuse, selon ses termes, est que les méthodes d’entraînement actuelles peuvent conduire des agents à adopter des objectifs propres, à enfreindre sciemment des consignes de sécurité et à dissimuler leurs actions.

C’est cette seconde lecture qui rend la note inhabituelle. Elle laisse ouverte la question de savoir si les garde-fous conçus aujourd’hui fonctionneront encore lorsque les agents pourront les comprendre et les contourner sciemment. Le résumé du groupe est sévère : le modèle traditionnel de protection se défait.

Des modèles aux agents, et de la gouvernance à la sécurité

La note définit la perte de contrôle comme une situation où les humains ne peuvent plus diriger, contraindre ou arrêter de façon fiable un système d’IA autonome. Elle soutient que le défi de gouvernance se déplace des modèles vers les agents, parce qu’une défaillance locale peut franchir les frontières organisationnelles et nationales. Sur cette base, le groupe avance que la sûreté de l’IA pourrait devenir une affaire de sécurité collective autant que de gouvernance d’entreprise.

Elle ne va pas jusqu’à prédire une perte de contrôle grave, et ne traite pas l’incertitude comme la preuve que ces systèmes resteront contrôlables. Le mandat du groupe est pertinent pour l’action publique mais non prescriptif : il passe en revue des approches plutôt que de formuler des exigences.

Ce que font déjà d’autres secteurs à haut risque

Une salle de débat vide avec des rangées de pupitres en bois et de micros
Les conclusions du groupe ne sont pas soumises à l'ONU. Image d'illustration. Héctor Berganza · pexels · Pexels License

Ces approches viennent de l’aviation, de la médecine et de la cybersécurité : signalement des incidents, examen indépendant et garde-fous en couches. Qinghua Lu, membre du groupe spécialisée en ingénierie et en sûreté de l’IA, a estimé que ces pratiques pourraient ne pas suffire à mesure que les agents deviennent plus capables, plus autonomes et plus difficiles à surveiller, et a plaidé pour une assurance au niveau du système couvrant l’IA et son environnement.

La note précise qu’aucun des instruments décrits ne garantit la sûreté, et que gérer ce risque exigerait beaucoup plus d’attention et de moyens qu’aujourd’hui.

Ce qu’il faut surveiller

Le groupe a été créé par la résolution A/RES/79/325 de l’Assemblée générale du 26 août 2025, dans le prolongement du Pacte numérique mondial. Ses notes alimentent le Dialogue mondial sur la gouvernance de l’intelligence artificielle, et ses conclusions ne sont soumises ni à l’examen ni à l’approbation de l’ONU. Le test est désormais de savoir si un gouvernement inscrira ces suggestions dans la loi, durant une semaine où plusieurs sont à New York avec l’IA à l’ordre du jour.