Begjæringen

Microsoft begjærte 4. september forenklet dom i den samlede opphavsrettssaken om KI som behandles av dommer Sidney Stein i den føderale domstolen på Manhattan. Selskapet hevder at trening av store språkmodeller på bøker og nyhetsartikler er fair use og bør avgjøres som et rettsspørsmål framfor i en rettssak. Den samlede saken omfatter krav fra The New York Times, Authors Guild og blant annet rundt 400 lokalaviser.

Argumentet hviler på materiale fra bevisinnhentingen, ikke bare på juridisk teori.

Hva loggene viser

Microsoft ga en sakkyndig engasjert av nyhetsutgiverne 8,2 millioner loggede Copilot-samtaler. Utvalget var ikke tilfeldig: det ble hentet ut med søkeord knyttet til saksøkernes egne nettsteder, altså filtrert til den delen av trafikken som med størst sannsynlighet ville inneholde journalistikken deres.

Av de 8,2 millioner postene inneholdt 59 545 minst 16 ord felles med nyhetsinnhold modellen var trent på — under én prosent av utvalget. For bøker oppgir Microsofts innlegg et enda lavere tall: 24 tilfeller av gjengitte avsnitt i de samme 8,2 millioner samtalene, 0,00029 prosent, uten noen treff i det hele tatt for 202 av de 212 bøkene saken gjelder.

Fasaden til en rettsbygning med steinsøyler
Begjæringen ligger hos dommer Sidney Stein i det sørlige distriktet i New York. Phil Evenden · pexels · Pexels License

Hvorfor striden handler om innrammingen

Tallet er ikke egentlig omstridt; det er betydningen som er det. Microsofts standpunkt er at en så lav andel, i et utvalg som bevisst er lagt til selskapets ugunst, viser at Copilot ikke erstatter journalistikken den bygger på, og at treningen er transformativ i den forstand fair use krever.

Utgiverne har hele veien ført et annet resonnement: at skaden først og fremst ikke er ordrett gjengivelse, men bruken av verket til å bygge et produkt som besvarer spørsmålene leseren ellers ville tatt med til publikasjonen. Etter den tesen er en lav gjengivelsesandel uvedkommende. Ingenting i Microsofts innlegg løser den uenigheten — det behandler kopieringsspørsmålet som utgiverne også reiste, og ber retten behandle det som hele saken.

Terskelen «minst 16 felles ord» er også verdt å merke seg. Det er en mekanisk overlappstest som teller treff som ikke ville være krenkende etter noen lesning, og det skjærer begge veier: den blåser opp råtallet samtidig som den gjør resultatet til et tak snarere enn et gulv.

Hyller med innbundne juridiske bind i et juridisk bibliotek
Ingen amerikansk ankedomstol har ennå avgjort om trening av en modell på vernet tekst er fair use. Christian Wasserfallen · pexels · Pexels License

Hvor dette hører hjemme

Innlegget kommer to dager etter at det amerikanske justisdepartementet fortalte den samme domstolen at trening av KI på nyheter er fair use, et standpunkt som plasserte den føderale regjeringen på de saksøktes side i en sak reist av en avis. Microsoft begynte samtidig 2. september å selge OpenAIs GPT-6 Astra via plattformen Foundry, til ti dollar per million inn-tokens.

Ingen amerikansk ankedomstol har ennå besvart fair use-spørsmålet for modelltrening, og distriktsdommere har kommet til motstridende konklusjoner. En avgjørelse fra dommer Stein i denne begjæringen ville ikke avgjøre saken nasjonalt, men den ville være den mest betydningsfulle avgjørelsen så langt i avissakene — og avslår han den, går spørsmålet til en jury.