Microsoft y OpenAI bajo fuego: nuevas revelaciones en la demanda por derechos de autor
Una nueva información no redactada en la demanda por derechos de autor que The New York Times presentó hace tres años contra OpenAI y Microsoft revela una admisión: el scraping de IA equivalía a un robo y los productos de IA representan una amenaza importante para las publicaciones.
Según la demanda, un alto ejecutivo de Microsoft describió en privado las prácticas de entrenamiento de IA de las empresas como “theft” (robo), y el propio liderazgo de OpenAI dijo que sus modelos de IA representaban una “existential threat” (amenaza existencial) para los editores y periodistas cuyo trabajo los entrenó.
El material desellado también detalla cómo las empresas supuestamente obtuvieron y usaron ese contenido al eludir muros de pago sin ser detectadas, construir conjuntos de datos de entrenamiento mediante scraping masivo y eliminar deliberadamente los avisos de derechos de autor de los datos de entrenamiento.
Gran parte de la nueva información proviene del propio escrito de The Times, no de las pruebas subyacentes, que permanecen selladas. Las citas se presentan sin su contexto original.

La escalada de una demanda de tres años
La presentación no redactada es la última escalada en la demanda de tres años, en la que The New York Times alegó inicialmente que las empresas violaron la ley de derechos de autor al entrenar modelos de IA generativa con su contenido.
La cuestión de si las empresas de IA pueden usar legalmente material protegido por derechos de autor para entrenar IA no tiene una respuesta clara, pero los jueces han sido en gran medida favorables a los argumentos de las compañías de IA de que el entrenamiento constituye “fair use” (uso justo). Esta regla legal permite usar obras protegidas sin permiso en ciertos casos, como parodia, reportajes de noticias o crítica.
Recientemente, la administración Trump presentó un escrito en defensa del uso no licenciado de material con derechos de autor por parte de OpenAI para entrenar sus LLM.
Sin embargo, varias de las nuevas admisiones contradicen la defensa de uso justo de OpenAI, en particular el requisito de que el uso no sustituya ni perjudique el mercado de la obra original.
Copilot, caída del 93% y el “doom loop”
Los propios datos de Microsoft muestran que su motor de respuestas Copilot provocó que las tasas de clics para el dominio de The New York Times cayeran hasta un 93% en comparación con la búsqueda tradicional de Bing.
Una presentación interna de Microsoft escrita por el director de Ciencias Aplicadas de Microsoft, Brent Hecht, en enero de 2024, describe la disminución como un “doom loop” que “hurt the performance of our models and the entire web at the same time” (perjudicaría el rendimiento de nuestros modelos y de toda la web al mismo tiempo).
“It is highly unusual that an end-product threatens the economic foundations of its essential suppliers, but that is the situation we have created for our LLM business with respect to its ‘content supply chain,’” lee el documento de Microsoft, según se cita en la presentación.
El CEO de Microsoft, Satya Nadella, también testificó en una deposición de este año que “anything that is paywalled should be licensed by anyone who wants to use it…for grounding or training” (cualquier cosa que esté detrás de un muro de pago debería ser licenciada por cualquiera que quiera usarla para fundamentación o entrenamiento), y dejó claro que, si se le hubiera informado de que OpenAI había scrapeado y entrenado con información detrás de un muro de pago, habría invocado el derecho de Microsoft a exigir que OpenAI reentrenara sus modelos.
OpenAI, ChatGPT y la amenaza existencial
Otras admisiones cortan contra diferentes pilares de la prueba de uso justo: el jefe de ChatGPT de OpenAI, Nick Turley, escribió en una comunicación interna que los editores enfrentan una “existential threat” (amenaza existencial) por productos como el chatbot, que son “largely substitutive” (en gran medida sustitutivos) y “will get more and more substitutive as they get better” (serán cada vez más sustitutivos a medida que mejoren).
El presidente de OpenAI, Greg Brockman, describió los modelos como “excellent at news” (excelentes en noticias). Nadella coincidió bajo juramento este año en que conversar con chatbots “has substituted … giving you the information right there on the website on the AI platform versus needing to go to the underlying source” (ha sustituido el darte la información directamente en el sitio web en la plataforma de IA frente a necesitar ir a la fuente original).
Ese tipo de lenguaje habla de cómo la tecnología podría competir directamente con la obra original, en lugar de transformarla.
Un documento de Microsoft afirma que existe un “real risk” (riesgo real) de que la IA generativa pueda “significantly disrupt the employment of the very people who generated the data on which the foundation model was trained” (interrumpir significativamente el empleo de las mismas personas que generaron los datos con los que se entrenó el modelo fundacional).
Escala del copiado: 91,692 copias y más de 2 millones de documentos
La escala de la copia es impactante. Los documentos revelan por primera vez que los conjuntos de datos de entrenamiento intermedio de OpenAI contienen más de 91,692 copias de obras publicadas por NYT, Daily News y Center for Investigative Reporting. Un conjunto de datos derivado de Common Crawl incluyó más de 2 millones de documentos solo de nytimes.com.
En un memo interno de enero de 2023, Hecht lo llamó “an astonishing theft of unprecedented proportions” (un robo asombroso de proporciones sin precedentes) y “the largest theft of labor in human history” (el mayor robo de trabajo en la historia humana).

Cómo supuestamente obtuvieron el contenido
La presentación detalla cómo OpenAI y Microsoft adquirieron el contenido de los demandantes, incluido el scraping desde el Bing Index.
“OpenAI delivered the entire GPT-3 training dataset to Microsoft, which Microsoft used to evaluate how to implement OpenAI’s models within its own commercial products,” lee la presentación. “Microsoft similarly provided training data to OpenAI through initiatives called Project Taxi and Project Mango.”
Las empresas supuestamente ensamblaron los datos de Project Mango en un conjunto de datos de entrenamiento que contiene copias de al menos 160,903 obras únicas de los editores de noticias.
Para aprovechar al máximo su scraping, los empleados de OpenAI supuestamente idearon un plan para eludir los muros de pago sin detección. Los documentos muestran que cuando el investigador de OpenAI Nick Ryder le contó a Brockman sobre un “hack to get around nytimes paywall” (truco para evitar el muro de pago de nytimes), Brockman respondió: “ah nice” (ah, genial).
Los empleados de OpenAI también supuestamente construyeron conjuntos de datos de entrenamiento como WebText y WebText2 que dependían desproporcionadamente de contenido de noticias scrapeado. También supuestamente extrajeron millones de artículos de Common Crawl, un repositorio gratuito y abierto de datos de rastreo web. Los hallazgos también describen esfuerzos deliberados para eliminar los avisos de derechos de autor de los datos de entrenamiento antes de que llegaran al modelo, ya que los investigadores “wouldn’t want model outputting” “copyright notices” (no querrían que el modelo emitiera avisos de derechos de autor) a los usuarios.
“The evidence revealed here for the first time shows that OpenAI and Microsoft knew that what they were doing was wrong,” dijo Steven Lieberman, abogado de New York Daily News, en una declaración.
OpenAI y Microsoft no respondieron a las solicitudes de comentarios.
Datos clave de la demanda
- Empresas demandadas: OpenAI y Microsoft
- Demandante inicial: The New York Times
- Antigüedad de la demanda: tres años
- Caída de clics con Copilot: hasta 93% frente a Bing
- Copias en datasets de OpenAI: más de 91,692
- Documentos de nytimes.com en dataset: más de 2 millones
- Obras únicas en dataset de Project Mango: al menos 160,903