Begæringen

Microsoft begærede 4. september forenklet dom i den samlede ophavsretssag om AI, der behandles af dommer Sidney Stein ved den føderale domstol på Manhattan. Selskabet hævder, at træning af store sprogmodeller på bøger og nyhedsartikler er fair use og bør afgøres som et retsspørgsmål frem for ved en retssag. Den samlede sag omfatter krav fra The New York Times, Authors Guild og blandt andet omkring 400 lokalaviser.

Argumentet hviler på materiale fra bevisindhentningen, ikke kun på juridisk teori.

Hvad logfilerne viser

Microsoft gav en sagkyndig, som nyhedsudgiverne havde hyret, 8,2 millioner loggede Copilot-samtaler. Udvalget var ikke tilfældigt: det blev udtrukket med søgeord knyttet til sagsøgernes egne websteder, altså filtreret til den del af trafikken, der med størst sandsynlighed ville indeholde deres journalistik.

Af de 8,2 millioner poster indeholdt 59.545 mindst 16 ord til fælles med nyhedsindhold, modellen var trænet på — under én procent af udvalget. For bøger angiver Microsofts indlæg et endnu lavere tal: 24 tilfælde af gengivne passager i de samme 8,2 millioner samtaler, 0,00029 procent, uden nogen som helst træf for 202 af de 212 bøger, sagen angår.

Facaden på en retsbygning med stensøjler
Begæringen ligger hos dommer Sidney Stein i det sydlige distrikt i New York. Phil Evenden · pexels · Pexels License

Hvorfor striden handler om indramningen

Tallet er ikke reelt omstridt; det er betydningen, der er det. Microsofts standpunkt er, at en så lav andel, i et udvalg der bevidst er lagt til selskabets ugunst, viser, at Copilot ikke erstatter den journalistik, den bygger på, og at træningen er transformativ i den forstand, fair use kræver.

Udgiverne har hele vejen ført et andet ræsonnement: at skaden ikke først og fremmest er ordret gengivelse, men brugen af værket til at bygge et produkt, der besvarer de spørgsmål, læseren ellers ville tage med til publikationen. Efter den tese er en lav gengivelsesandel uvedkommende. Intet i Microsofts indlæg løser den uenighed — det behandler kopieringsspørgsmålet, som udgiverne også rejste, og beder retten behandle det som hele sagen.

Tærsklen «mindst 16 fælles ord» er også værd at bemærke. Det er en mekanisk overlapstest, der tæller træf, som ikke ville være krænkende efter nogen læsning, og det skærer begge veje: den puster råtallet op og gør samtidig resultatet til et loft snarere end et gulv.

Hylder med indbundne juridiske bind i et juridisk bibliotek
Ingen amerikansk appeldomstol har endnu afgjort, om træning af en model på beskyttet tekst er fair use. Christian Wasserfallen · pexels · Pexels License

Hvor dette hører hjemme

Indlægget kommer to dage efter, at det amerikanske justitsministerium fortalte den samme domstol, at træning af AI på nyheder er fair use, et standpunkt der placerede den føderale regering på de sagsøgtes side i en sag anlagt af en avis. Microsoft begyndte samtidig 2. september at sælge OpenAIs GPT-6 Astra via platformen Foundry, til ti dollar per million input-tokens.

Ingen amerikansk appeldomstol har endnu besvaret fair use-spørgsmålet for modeltræning, og distriktsdommere er nået til modstridende konklusioner. En afgørelse fra dommer Stein i denne begæring ville ikke afgøre sagen nationalt, men den ville være den mest betydningsfulde afgørelse hidtil i avissagerne — og afviser han den, går spørgsmålet til en jury.