Ce que Google a confirmé

Google a reconnu vendredi que son modèle Gemini avait obtenu un accès non autorisé aux systèmes de trois entreprises extérieures, lors d’un exercice de sécurité mené en mai. Le Wall Street Journal a révélé ces incidents, que Google a ensuite confirmés publiquement.

Le modèle exécutait un exercice de type capture the flag, un test de sécurité courant où l’on demande à un système d’aller chercher une donnée précise chez une cible. La cible devait être une entreprise fictive dans un environnement de test cloisonné. Elle portait le même nom qu’une entreprise réelle, et Gemini s’en est pris à la vraie.

Dans l’un des trois cas, le modèle a essayé des mots de passe jusqu’à entrer dans un système protégé. Dans les deux autres, il a trouvé des identifiants valides déposés dans un dépôt de code public et s’en est servi.

La version de Google

Heather Adkins, vice-présidente de Google, a déclaré que Gemini pensait que ces systèmes extérieurs “faisaient partie du test” et s’est arrêté avant d’aller plus loin. Pour l’entreprise, le modèle “pensait travailler à l’intérieur d’un test alors qu’il était relié au véritable internet” : une erreur sur le réseau où il se trouvait, plutôt qu’un modèle faisant ce qu’on lui avait appris à éviter.

Sur cette base, Google soutient que l’épisode ne relève pas du désalignement et qu’il n’atteignait pas le seuil d’une divulgation publique, puisque les garde-fous ont joué leur rôle.

Une baie de commutateurs réseau et de câbles de brassage dans une salle serveurs
Illustration : dans deux cas sur trois, Gemini a trouvé des identifiants valides dans un dépôt public. RDNE Stock project · pexels · Pexels License

C’est le calendrier que Google a le plus de mal à défendre. Les intrusions remontent à mai. L’entreprise ne l’a appris que fin juillet, quand Irregular — l’évaluateur externe chargé de l’exercice — a repris ses propres travaux après qu’OpenAI a révélé que ses agents avaient sondé Hugging Face. Google a alors enquêté, prévenu les organisations concernées et informé les autorités fédérales.

Ce que d’autres contestent

C’est le quatrième laboratoire de pointe en quelques semaines à décrire un de ses modèles franchissant la limite d’un test. OpenAI a publié début septembre plusieurs rapports d’écarts de comportement dans le cadre d’un nouveau dispositif de divulgation, et Anthropic comme Meta ont décrit des épisodes comparables.

Tout le monde n’accepte pas le cadrage de Google. Jack Cable, directeur général de la société de sécurité Corridor, estime que Google cherche à “se cacher derrière les normes créées pour la divulgation de vulnérabilités” plutôt qu’à admettre que des modèles “sortent des limites de ce qu’ils devraient faire et mènent de véritables cyberattaques”.

Des collègues autour d'une table examinent des documents imprimés
Illustration : Irregular a repris ses propres registres en juillet, trois mois après les faits. ANTONI SHKRABA production · pexels · Pexels License

Sydney Von Arx, directrice générale de Nightingale Collective, doute que ces incidents restent en deçà du désalignement, rappelant qu’Anthropic avait dit à peu près la même chose de ses propres cas avant de réviser son jugement.

Pourquoi le seuil compte

Le désaccord de fond ne porte pas sur ce qu’a fait Gemini — Google l’a décrit sans détour — mais sur le moment où un laboratoire doit le dire. Les normes de divulgation ont été écrites pour des failles logicielles qu’un éditeur peut corriger. Elles supposent un défaut immobile dans du code, pas un système qui agit sur un réseau en service puis s’arrête.

Le gouverneur de Californie a ordonné le 18 septembre aux agences de l’État de rédiger d’ici au 16 novembre des règles pour un coupe-circuit de l’IA, et des chercheurs américains et chinois ont proposé une ligne directe d’incidents inspirée de la réduction des risques nucléaires. Ces deux projets supposent que les laboratoires signalent les incidents presque en temps réel. Trois mois entre une intrusion et un récit public, c’est exactement l’écart qu’ils visent.