La petición
Microsoft presentó el 4 de septiembre una solicitud de fallo sumario en el litigio consolidado sobre derechos de autor e inteligencia artificial que instruye el juez Sidney Stein en el tribunal federal de Manhattan. Sostiene que entrenar grandes modelos de lenguaje con libros y artículos periodísticos es uso legítimo y debe resolverse como cuestión de derecho, sin llegar a juicio. El caso consolidado agrupa demandas de The New York Times, el Authors Guild y, entre otros, unos 400 diarios locales.
El argumento se apoya en datos de la fase de prueba, no solo en doctrina.
Qué muestran los registros
Microsoft entregó a un perito contratado por los editores de prensa 8,2 millones de registros de conversaciones de Copilot. La muestra no era aleatoria: se seleccionó con palabras clave vinculadas a los sitios web de los medios demandantes, es decir, se filtró para quedarse con la parte del tráfico con más probabilidad de contener su periodismo.
De esos 8,2 millones de registros, 59.545 contenían al menos 16 palabras coincidentes con contenido informativo con el que se entrenó el modelo: menos del uno por ciento de la muestra. En libros, el escrito de Microsoft rebaja aún más la cifra: 24 casos de pasajes reproducidos en esas mismas 8,2 millones de conversaciones, un 0,00029 por ciento, sin ninguna coincidencia para 202 de los 212 libros en cuestión.

Por qué la disputa es de encuadre
La cifra no está realmente en discusión; lo que significa, sí. La posición de Microsoft es que una tasa tan baja, en una muestra cargada deliberadamente en su contra, demuestra que Copilot no sustituye al periodismo de origen y que el entrenamiento es transformador en el sentido que exige el uso legítimo.
Los editores han sostenido a lo largo del litigio otra cosa: que el daño no es principalmente la reproducción literal, sino el uso de la obra para construir un producto que responde a las preguntas que el lector llevaría a la publicación. Bajo esa tesis, una tasa baja de reproducción es irrelevante. Nada en el escrito de Microsoft resuelve ese desacuerdo: aborda la cuestión de la copia que los editores también plantearon y pide al tribunal que la trate como el caso entero.
El umbral de “16 palabras coincidentes” también merece atención. Es una prueba mecánica de solapamiento y cuenta coincidencias que no serían infractoras bajo ninguna lectura, lo que corta en ambos sentidos: infla el recuento bruto y a la vez convierte la cifra resultante en un techo, no en un suelo.

Dónde encaja esto
El escrito llega dos días después de que el Departamento de Justicia estadounidense dijera al mismo tribunal que entrenar IA con noticias es uso legítimo, una postura que situó al gobierno federal del lado de los demandados en un pleito iniciado por un periódico. Microsoft, por su parte, empezó el 2 de septiembre a vender GPT-6 Astra, de OpenAI, a través de su plataforma Foundry, a diez dólares por millón de tokens de entrada.
Ningún tribunal de apelación estadounidense ha respondido todavía a la pregunta del uso legítimo aplicada al entrenamiento de modelos, y los jueces de distrito han llegado a conclusiones contradictorias. Un fallo del juez Stein sobre esta petición no zanjaría la cuestión a nivel nacional, pero sería la decisión más relevante hasta la fecha en los casos de prensa; y si la deniega, el asunto pasa a un jurado.