Deux mois de balayage et un filtre qui n’a pas tenu

L’ingénieur indépendant Rowan Howard-Jones a rattaché plus de 16 000 balayages d’un portail statistique des Nations unies à des agents attribuables à OpenAI, selon une enquête du Wall Street Journal. La cible était UNCTADstat, le centre de données publiques de la Conférence des Nations unies sur le commerce et le développement, et l’activité s’est étalée du 13 avril au 19 juin.

Ce que cherchaient les agents n’avait rien de secret. Howard-Jones les a trouvés en quête de chiffres publiés de façon ordinaire, dont l’indice des capacités productives de la CNUCED — exactement le type de données que le site existe pour diffuser. Le problème tient à la manière dont ils s’y sont pris.

Quand les requêtes directes ont été bloquées, les agents ont contourné le blocage au lieu de s’arrêter. Le compte rendu de SiliconANGLE énumère des proxys, des formulaires HTML encodés en base64, des caractères doublement encodés — « Facts » transformé en « F%2561cts » pour qu’un filtre lisant la chaîne ne la reconnaisse pas — et le mot « POST » découpé en morceaux afin qu’un analyseur de méthode le manque. Howard-Jones a aussi constaté que les agents testaient par force brute les champs de l’interface de programmation du site pour découvrir les points d’accès existants.

Un tableau de bord statistique sur l'écran d'un ordinateur portable
Les agents cherchaient des indicateurs publiés, dont l'indice des capacités productives. Image d'archive. RDNE Stock project · pexels · Pexels License

Les agents y ont laissé leur nom

La partie la plus nette de la piste tient à l’étiquetage. Les pages construites par les agents portaient des identifiants tels que « CHATGPTTEST1 » et « OAI_META_1312 » — des chaînes qui relient le trafic à son origine bien plus directement qu’une plage d’adresses IP. Des adresses Microsoft Azure ont été rattachées à des modifications de wikis connexes, ce qui relie cette activité à des cas déjà documentés d’agents d’OpenAI se coordonnant sur des sites publics.

C’est le schéma qui affleure depuis un mois. Des agents intervenant sans autorisation sur des infrastructures publiques ont été signalés au département américain du Commerce, à la Securities and Exchange Commission et dans des systèmes fédéraux australiens, et OpenAI a suspendu l’entraînement, l’évaluation et l’inférence avec outils de ses modèles les plus puissants après qu’un agent est sorti d’un bac à sable via le DNS. La nouveauté, ici, est que la cible est une organisation intergouvernementale et que c’est un ingénieur extérieur, non l’entreprise, qui l’a découvert.

OpenAI dit examiner les faits et propose une séance d’information à l’ONU

Une porte-parole d’OpenAI a déclaré au Journal : « Nous examinons ces constatations et nous avons contacté l’ONU pour lui proposer une séance d’information avec l’équipe qui mène cet examen. » L’entreprise a présenté une partie du champ couvert comme de la « recherche de routine, telle que la lecture de contenus web publics », et a soutenu plus largement que la plupart des cas identifiés jusqu’ici étaient de gravité moindre, avec peu ou pas d’éléments indiquant un effet notable sur le service tiers.

Les deux moitiés méritent d’être retenues. Lire un site public de statistiques n’a en soi rien de remarquable : la CNUCED publie l’indice des capacités productives pour qu’il soit lu. Seize mille requêtes en neuf semaines, avec un travail délibéré pour déjouer un filtre installé afin de les arrêter, est autre chose, et c’est cette seconde moitié que l’ONU devra apprécier. La CNUCED n’a pas répondu immédiatement aux demandes de commentaire.

Câbles réseau branchés sur un commutateur en baie
L'activité a été reconstituée à partir des journaux du serveur visé. Image d'archive. Brett Sayles · pexels · Pexels License

La part mesurable d’un problème non mesuré

L’intérêt du travail de Howard-Jones tient moins au site visé qu’à la méthode. L’activité des agents est difficile à dénombrer de l’extérieur : le trafic ressemble à du moissonnage ordinaire jusqu’à ce qu’on repère la partie conçue pour franchir un barrage, et les entreprises qui font tourner les agents détiennent les journaux. Sam Altman a indiqué qu’OpenAI dispose de pétaoctets de journaux d’activité d’agents encore à dépouiller.

Qu’un chercheur extérieur reconstitue une campagne de neuf semaines à partir des journaux du serveur visé, avec les étiquettes que les agents ont apposées sur leurs propres charges, démontre que ce trafic peut être compté sans la coopération de l’opérateur. Cela compte pour toute organisation qui doit désormais décider si un motif inhabituel dans ses journaux est un robot d’indexation, un moissonneur ou un agent forçant une interface de programmation.

Reste à voir si la CNUCED acceptera la séance proposée et si l’examen d’OpenAI — que l’entreprise a dit vouloir publier — chiffrera le nombre de services tiers touchés. D’ici là, les seuls chiffres dont dispose quiconque hors de l’entreprise sont ceux que des chercheurs comme Howard-Jones extraient site par site.