Ejecutivo de Microsoft llamó al scraping de IA "el mayor robo de trabajo en la historia de la humanidad", muestran documentos sin censura del caso NYT contra OpenAI

✍️ OpenClawRadar📅 Publicado: 18 de septiembre de 2026🔗 Source
Ad

Material recién desclasificado en la demanda por derechos de autor The New York Times v. OpenAI and Microsoft incluye comunicaciones internas de Microsoft y OpenAI que debilitan la defensa de uso legítimo de las empresas. TechCrunch informa que el escrito afirma que un director de Ciencias Aplicadas de Microsoft, Brent Hecht, describió la adquisición de datos de entrenamiento por parte de las empresas en un memorando de enero de 2023 como "un asombroso robo de proporciones sin precedentes" y "el mayor robo de mano de obra en la historia de la humanidad".

Lo que alegan los escritos

  • Las empresas supuestamente eludieron los muros de pago sin ser detectadas, construyeron conjuntos de datos de entrenamiento mediante scraping masivo y eliminaron los avisos de derechos de autor de los datos de entrenamiento.
  • Solo los conjuntos de datos de entrenamiento intermedio de OpenAI contienen más de 91.692 copias de obras publicadas por el NYT, el Daily News y el Center for Investigative Reporting.
  • Un conjunto de datos derivado de Common Crawl incluía más de 2 millones de documentos solo de nytimes.com.
  • Los propios datos de Microsoft muestran que su "motor de respuestas" Copilot redujo las tasas de clics para el dominio del NYT hasta en un 93% frente a la búsqueda tradicional de Bing.

El documento interno del "bucle de perdición"

Una presentación de Microsoft de enero de 2024 realizada por Hecht describió la caída de tráfico como un "bucle de perdición" que "perjudicaría el rendimiento de nuestros modelos y de toda la web al mismo tiempo", y advirtió: "Es muy inusual que un producto final amenace los fundamentos económicos de sus proveedores esenciales, pero esa es la situación que hemos creado para nuestro negocio de LLM con respecto a su 'cadena de suministro de contenido'." Un documento separado de Microsoft señala un "riesgo real" de que la IA generativa pueda "interrumpir significativamente el empleo de las mismas personas que generaron los datos con los que se entrenó el modelo fundacional".

Ad

Declaraciones que van en contra del uso legítimo

  • El CEO de Microsoft, Satya Nadella, testificó este año que "cualquier cosa que esté detrás de un muro de pago debería ser licenciada por cualquiera que quiera usarla... para fundamentar o entrenar", y dijo que habría exigido a OpenAI volver a entrenar si hubiera sabido que extrajo datos de muros de pago.
  • El responsable de ChatGPT de OpenAI, Nick Turley, escribió internamente que los editores enfrentan una "amenaza existencial" porque el chatbot es "en gran medida sustitutivo" y "será cada vez más sustitutivo a medida que mejore"
  • El presidente de OpenAI, Greg Brockman, describió los modelos como "excelentes en noticias". Nadella aceptó bajo juramento que conversar con un bot sustituye la visita al sitio web de origen.

Contexto

El caso lleva tres años; los jueces generalmente se han inclinado hacia las empresas de IA en materia de uso legítimo, y la administración Trump presentó este mes un escrito defendiendo el entrenamiento sin licencia de OpenAI. Advertencia: gran parte del nuevo material proviene del propio escrito de The Times, no de las pruebas selladas subyacentes, y los pasajes citados se presentan sin su contexto original. Para los desarrolladores que implementan RAG o pipelines de entrenamiento, el descubrimiento aquí es un recordatorio de que la procedencia de los datos y los términos de licencia se están convirtiendo en evidencia judicial, no solo en higiene de ingeniería.

📖 Lee la fuente completa: HN AI Agents

Ad

👀 Ver también

La IA se está desacelerando: Se necesitan $3 billones en ingresos para 2030 para mantener la burbuja
Noticias

La IA se está desacelerando: Se necesitan $3 billones en ingresos para 2030 para mantener la burbuja

Ed Zitron argumenta que la IA generativa se está desacelerando, no acelerando, y la economía simplemente no cuadra. El artículo se centra en los asombrosos requisitos de capital: 3 billones de dólares o más en ingresos para finales de 2030 para sostener la existencia de la industria de la IA, basado en los costos de construcción de centros de datos y los compromisos de los hiperescaladores.

OpenClawRadar
Cowork Hardcodes Medium Effort e Ignora la Configuración del Usuario para Claude Opus
Noticias

Cowork Hardcodes Medium Effort e Ignora la Configuración del Usuario para Claude Opus

Un usuario del plan Max descubrió que Cowork pasa --effort medium --model claude-opus-4-6 como banderas CLI codificadas, ignorando variables de entorno y anulaciones de settings.json. Esto significa que los usuarios están bloqueados en esfuerzo medio y ventana de contexto estándar a pesar de pagar por esfuerzo alto y acceso a contexto de 1 millón.

OpenClawRadar
🦀
Noticias

La IA está resolviendo desafíos CTF en minutos — qué significa esto para la formación en ciberseguridad

En BSidesSF 2026, un agente autónomo resolvió los 52 desafíos CTF en minutos, ganando el primer lugar. Esto obliga a repensar cómo se miden y entrenan las habilidades de ciberseguridad.

OpenClawRadar
Microsoft cancela licencias de Claude Code: agentes de IA demasiado costosos para escalar
Noticias

Microsoft cancela licencias de Claude Code: agentes de IA demasiado costosos para escalar

Microsoft cancela la mayoría de las licencias directas de Claude Code y traslada a sus ingenieros a GitHub Copilot CLI. Uber agotó su presupuesto de IA para 2026 en 4 meses. El costo por tarea en tokens puede aumentar a pesar de la reducción de precios.

OpenClawRadar