O requerimento
A Microsoft apresentou a 4 de setembro um pedido de decisão sumária no litígio consolidado sobre direitos de autor e inteligência artificial que corre perante o juiz Sidney Stein, no tribunal federal de Manhattan. Sustenta que treinar grandes modelos de linguagem com livros e artigos de imprensa é uso legítimo e deve ser decidido como questão de direito, sem julgamento. O processo consolidado junta pedidos do The New York Times, do Authors Guild e, entre outros, de cerca de 400 jornais locais.
O argumento assenta em dados da fase de prova, não apenas em doutrina.
O que mostram os registos
A Microsoft entregou a um perito contratado pelos editores de imprensa 8,2 milhões de registos de conversas do Copilot. A amostra não era aleatória: foi selecionada com palavras-chave ligadas aos sítios dos meios queixosos, ou seja, filtrada para reter a parte do tráfego com maior probabilidade de conter o seu jornalismo.
Desses 8,2 milhões de registos, 59 545 continham pelo menos 16 palavras em comum com conteúdo noticioso usado no treino do modelo — menos de um por cento da amostra. Quanto a livros, a peça da Microsoft aponta um número ainda mais baixo: 24 casos de passagens reproduzidas nas mesmas 8,2 milhões de conversas, 0,00029 por cento, sem qualquer correspondência para 202 dos 212 livros em causa.

Porque a disputa é de enquadramento
O número não está verdadeiramente em causa; o seu significado está. A posição da Microsoft é que uma taxa tão baixa, numa amostra deliberadamente desfavorável, mostra que o Copilot não substitui o jornalismo de origem e que o treino é transformativo no sentido exigido pelo uso legítimo.
Os editores têm defendido outra coisa ao longo do processo: que o dano não é sobretudo a reprodução literal, mas o uso da obra para construir um produto que responde às perguntas que o leitor levaria à publicação. Nessa tese, uma taxa baixa de reprodução é irrelevante. Nada na peça da Microsoft resolve esse desacordo — trata a questão da cópia, também levantada pelos editores, e pede ao tribunal que a tome pelo processo inteiro.
O limiar de “16 palavras em comum” também merece nota. É um teste mecânico de sobreposição e conta correspondências que não seriam ilícitas em leitura nenhuma, o que corta dos dois lados: inflaciona a contagem bruta e, ao mesmo tempo, torna o resultado um teto e não um piso.

Onde isto se insere
A peça surge dois dias depois de o Departamento de Justiça norte-americano ter dito ao mesmo tribunal que treinar IA com notícias é uso legítimo, posição que colocou o governo federal do lado dos réus num processo movido por um jornal. A Microsoft, por seu lado, começou a 2 de setembro a vender o GPT-6 Astra da OpenAI através da sua plataforma Foundry, a dez dólares por milhão de tokens de entrada.
Nenhum tribunal de recurso norte-americano respondeu ainda à questão do uso legítimo aplicada ao treino de modelos, e juízes de primeira instância chegaram a conclusões contraditórias. Uma decisão do juiz Stein sobre este requerimento não resolveria a questão a nível nacional, mas seria a decisão mais relevante até hoje nos casos da imprensa — e, se a indeferir, a questão segue para um júri.