Ce qu’OpenAI active

OpenAI a annoncé lundi qu’elle ajouterait dans les prochaines semaines un filigrane invisible au texte produit par ChatGPT et Codex dans l’Union européenne, sur toutes les formules. Dès le même jour, les clients de l’API, partout dans le monde, peuvent l’activer pour certains modèles. Dans l’API, il reste désactivé par défaut, et l’entreprise précise qu’elle « ne fait pas du filigrane de texte un réglage mondial par défaut au lancement ».

Le déclencheur est le règlement européen sur l’IA, qui impose aux fournisseurs d’IA générative de rendre le texte produit par une machine identifiable de façon lisible par machine. OpenAI ouvre aussi les candidatures pour accéder à son détecteur, accordé au cas par cas à des chercheurs et organisations expertes agréés, conformément au code de bonnes pratiques européen. Il ne sera pas public.

textGrain, et son effet sur le modèle

La technologie s’appelle textGrain et consiste à insérer un signal statistique invisible dans les choix de mots du modèle. OpenAI affirme que textGrain a égalé ou dépassé les autres approches testées, dont SynthID pour le texte de Google, et qu’elle compte publier la technologie en open source.

Le clavier d'un ordinateur portable photographié de près sur un bureau
Le filigrane insère un signal statistique dans les choix de mots. Photographie d'illustration. Christian Naccarato · pexels · Pexels License

L’entreprise a publié des résultats de référence pour Astra avec et sans filigrane, sans écart significatif : 49,57 contre 49,76 points sur l’Artificial Analysis Intelligence Index, 94,44 % contre 93,94 % sur GPQA Diamond et 53,90 % contre 56,06 % sur Terminal-Bench 4.0. Ce sont les chiffres d’OpenAI sur son propre modèle.

Les chiffres qui fragilisent l’idée

Le plus intéressant du billet est la franchise avec laquelle il expose les limites. À un taux cible de faux positifs de 1 %, OpenAI indique que son détecteur a trouvé le filigrane dans environ 80 % des passages de 200 jetons et environ 95 % de ceux de 400 jetons pour des contenus comme la psychologie. En mathématiques, où le choix des mots est plus contraint, la détection était nettement plus faible.

La retouche le dégrade plus vite. Sur des passages de 400 jetons, remplacer 10 % des mots par des synonymes a fait passer la détection d’environ 92 % à 66 %. En remplacer 25 % l’a ramenée à 17 %. C’est le chiffre à retenir : une réécriture légère défait la marque.

Des drapeaux de l'Union européenne flottant devant un bâtiment
L'exigence vient du règlement européen sur l'IA. Photographie d'illustration. Christian Wasserfallen · pexels · Pexels License

OpenAI le dit clairement : une détection ne mesure pas l’apport humain, n’établit ni la propriété ni la responsabilité, n’identifie pas l’utilisateur et ne vérifie pas l’exactitude ; et l’absence de filigrane ne prouve pas qu’un humain a écrit le texte, celui-ci pouvant être trop court, retouché, traduit, issu d’un modèle non pris en charge ou des outils d’une autre entreprise.

À surveiller

L’entreprise applique déjà des Content Credentials aux images prises en charge, se conforme à C2PA et intègre des filigranes SynthID dans les images et l’audio pris en charge, avec des outils de vérification publics pour les deux. Le texte est la partie qui résiste à la méthode, parce que c’est la partie que les gens réécrivent. À suivre : le rapport technique mis à jour, la publication en open source, et l’élargissement éventuel de l’accès au détecteur.