La discusión sobre si una inteligencia artificial puede entrenarse con millones de artículos protegidos por derechos de autor lleva años girando alrededor de una misma pregunta: ¿utilizar esos textos para aprender es equivalente a copiarlos o se trata de un uso transformador?
Ahora conocemos algo que hasta hace poco ocurría puertas adentro. Documentos que dejaron de estar censurados dentro del litigio que enfrenta a The New York Times y otros medios con OpenAI y Microsoft recogen conversaciones en las que empleados y ejecutivos discutían abiertamente el impacto que sus sistemas podían tener sobre quienes producían el contenido utilizado para entrenarlos. El escrito presentado por los demandantes cita incluso a Brent Hecht, director de ciencia aplicada de Microsoft, describiéndolo como potencialmente “el mayor robo laboral de la historia”.
No es una conclusión de Microsoft como compañía ni una decisión judicial. La empresa sostiene que esas palabras reflejan la opinión individual de un empleado y no constituyen un análisis legal. Pero los documentos revelan que el problema ya se discutía internamente mientras la IA generativa comenzaba a despegar.
Había otro temor: que la IA destruyera su propia fuente de información

La frase del “robo” es la más llamativa, pero posiblemente no sea la parte más interesante. Otro documento interno de Microsoft hablaba de un “doom loop”, un círculo vicioso en el que los asistentes de IA reducen el tráfico que reciben las páginas originales, perjudican sus ingresos y, eventualmente, deterioran la producción de contenido nuevo que después necesitan esos mismos modelos.
El escrito judicial de los medios cita datos internos de Microsoft según los cuales el porcentaje de usuarios que hacía clic hacia dominios de The New York Times y otros periódicos desde Copilot era entre 83% y 93% menor que desde el buscador tradicional de Bing. Es un dato aportado por los demandantes a partir de documentación obtenida durante el proceso, no una conclusión independiente del tribunal.
La preocupación también aparece del lado de OpenAI. Según los documentos, Nick Turley, responsable de ChatGPT, describió a los productos de IA como “largely substitutive” y advirtió que lo serían cada vez más a medida que mejoraran. Greg Brockman, por su parte, escribió que los modelos eran especialmente buenos trabajando con noticias.
Ahí está precisamente una de las claves legales del caso. OpenAI y Microsoft sostienen que el entrenamiento es un uso legítimo (fair use) porque transforma el material original en modelos capaces de producir resultados nuevos. Los medios argumentan lo contrario: que si esos sistemas sustituyen la necesidad de visitar el artículo original, también pueden competir directamente con él.
Los documentos también llegan hasta los muros de pago

El material desclasificado añade un elemento particularmente incómodo. En su escrito, los demandantes citan una conversación en la que el investigador de OpenAI Nick Ryder informó a Brockman de un “hack” para sortear el muro de pago de The New York Times mientras trabajaban en la recopilación de contenido. La respuesta atribuida a Brockman fue simplemente: “ah nice”.
El mismo documento sostiene que algunos conjuntos de datos contenían enormes cantidades de material periodístico. Uno de los datasets utilizados durante fases posteriores del entrenamiento incluía más de 91.000 copias de obras pertenecientes a los medios demandantes, mientras que otro proyecto conjunto entre Microsoft y OpenAI habría reunido al menos 160.903 obras únicas.
Satya Nadella declaró durante el proceso que cualquier contenido situado detrás de un muro de pago debería licenciarse para utilizarlo en entrenamiento o para alimentar respuestas de IA. También afirmó que habría exigido reentrenar los modelos si hubiese sabido que OpenAI había utilizado material obtenido de esa forma.
OpenAI mantiene una posición muy diferente a la de los demandantes. La compañía afirma que entrenar modelos con información disponible públicamente está protegido por el fair use, sostiene que sus sistemas son transformadores y defiende que la IA puede beneficiar también a las redacciones.
El tribunal todavía tendrá que decidir qué peso jurídico tiene todo esto. Pero los documentos dejan algo bastante claro antes de que exista una sentencia: mucho antes de que la crisis de tráfico de los medios se convirtiera en una discusión pública, dentro de las propias empresas de IA ya estaban preguntándose qué ocurriría cuando la gente dejara de necesitar hacer clic.