La requête
Microsoft a déposé le 4 septembre une demande de jugement sommaire dans le contentieux consolidé sur le droit d’auteur et l’IA instruit par le juge Sidney Stein au tribunal fédéral de Manhattan. L’entreprise soutient que l’entraînement de grands modèles de langage sur des livres et des articles de presse relève du fair use et devrait être tranché en droit plutôt qu’au procès. L’affaire consolidée regroupe les demandes du New York Times, de l’Authors Guild et, entre autres, de quelque 400 journaux locaux.
L’argument s’appuie sur des données issues de la phase probatoire, pas seulement sur la doctrine.
Ce que montrent les journaux de conversation
Microsoft a remis à un expert mandaté par les éditeurs de presse 8,2 millions de journaux de conversations Copilot. L’échantillon n’était pas aléatoire : il a été constitué à partir de mots-clés liés aux sites des médias plaignants, autrement dit filtré pour ne garder que la part du trafic la plus susceptible de contenir leur journalisme.
Sur ces 8,2 millions d’enregistrements, 59 545 comportaient au moins 16 mots communs avec des contenus de presse ayant servi à l’entraînement, soit moins de un pour cent de l’échantillon. Pour les livres, le mémoire de Microsoft avance un chiffre encore plus faible : 24 cas de passages reproduits sur les mêmes 8,2 millions de conversations, soit 0,00029 pour cent, et aucune correspondance pour 202 des 212 livres en cause.

Pourquoi le débat porte sur le cadrage
Le chiffre n’est pas vraiment contesté ; sa signification l’est. Pour Microsoft, un taux aussi bas, dans un échantillon délibérément défavorable, montre que Copilot ne se substitue pas au journalisme d’origine et que l’entraînement est transformatif au sens qu’exige le fair use.
Les éditeurs défendent depuis le début une autre thèse : le préjudice ne tient pas d’abord à la reproduction littérale, mais à l’usage de l’œuvre pour construire un produit qui répond aux questions que le lecteur porterait sinon à la publication. Dans cette logique, un faible taux de reproduction est hors sujet. Rien dans le mémoire de Microsoft ne tranche ce désaccord : il traite la question de la copie, également soulevée par les éditeurs, et demande au tribunal d’y voir toute l’affaire.
Le seuil de « 16 mots communs » mérite aussi d’être relevé. C’est un test mécanique de recouvrement, qui compte des correspondances qui ne seraient contrefaisantes selon aucune lecture, ce qui joue dans les deux sens : il gonfle le décompte brut tout en faisant du résultat un plafond plutôt qu’un plancher.

Où cela se situe
Le dépôt intervient deux jours après que le ministère américain de la Justice a indiqué au même tribunal que l’entraînement d’une IA sur la presse relève du fair use, position qui a rangé le gouvernement fédéral du côté des défendeurs dans une procédure engagée par un quotidien. Microsoft, de son côté, a commencé le 2 septembre à commercialiser GPT-6 Astra d’OpenAI via sa plateforme Foundry, à dix dollars le million de tokens d’entrée.
Aucune cour d’appel américaine n’a encore répondu à la question du fair use pour l’entraînement des modèles, et les juges de district ont abouti à des conclusions contradictoires. Une décision du juge Stein sur cette requête ne trancherait pas le sujet à l’échelle nationale, mais ce serait la décision la plus lourde à ce jour dans les affaires de presse — et s’il la rejette, la question part devant un jury.