Microsoft-Manager nannte KI-Scraping „den größten Arbeitsdiebstahl der Menschheitsgeschichte“, zeigen unredigierte Gerichtsunterlagen im Fall NYT gegen OpenAI
Neu freigegebenes, unredigiertes Material im Urheberrechtsprozess The New York Times v. OpenAI and Microsoft enthält interne Kommunikation von Microsoft und OpenAI, die die Fair-Use-Verteidigung der Unternehmen untergräbt. TechCrunch berichtet, dass in den Unterlagen ein Microsoft-Direktor für Angewandte Wissenschaft, Brent Hecht, die Beschaffung von Trainingsdaten durch die Unternehmen in einem Memo vom Januar 2023 als „einen erstaunlichen Diebstahl von beispiellosem Ausmaß“ und „den größten Arbeitsdiebstahl der Menschheitsgeschichte“ beschrieb.
Was die Unterlagen behaupten
- Die Unternehmen sollen Paywalls unentdeckt umgangen, Trainingsdatensätze durch massenhaftes Scraping erstellt und Urheberrechtshinweise aus den Trainingsdaten entfernt haben.
- Allein die Mid-Training-Datensätze von OpenAI enthalten mehr als 91.692 Kopien von Werken, die von der NYT, der Daily News und dem Center for Investigative Reporting veröffentlicht wurden.
- Ein von Common Crawl abgeleiteter Datensatz enthielt allein mehr als 2 Millionen Dokumente von nytimes.com.
- Microsofts eigene Daten zeigen, dass seine Copilot-„Antwortmaschine“ die Klickrate für die NYT-Domain um bis zu 93 % im Vergleich zur traditionellen Bing-Suche senkte.
Das interne Dokument zur „Doom Loop“
Eine Microsoft-Präsentation von Hecht vom Januar 2024 beschrieb den Verkehrsrückgang als „Doom Loop“, der „die Leistung unserer Modelle und des gesamten Webs gleichzeitig schädigen“ würde, und warnte: „Es ist höchst ungewöhnlich, dass ein Endprodukt die wirtschaftlichen Grundlagen seiner wesentlichen Zulieferer bedroht, aber genau diese Situation haben wir für unser LLM-Geschäft im Hinblick auf seine ‚Content Supply Chain‘ geschaffen.“ Ein separates Microsoft-Dokument markiert ein „real risk“, dass generative KI „die Beschäftigung genau der Menschen erheblich stören könnte, die die Daten erzeugt haben, mit denen das Foundation-Modell trainiert wurde“.
Aussagen, die gegen Fair Use sprechen
- Microsoft-CEO Satya Nadella sagte dieses Jahr aus, dass „alles, was hinter einer Paywall steht, von jedem lizenziert werden sollte, der es nutzen möchte … für Grounding oder Training“, und erklärte, er hätte OpenAI zu einem Retraining verpflichtet, wenn er gewusst hätte, dass paywallgeschützte Daten gescrapt wurden.
- OpenAIs ChatGPT-Leiter Nick Turley schrieb intern, Verlage stünden vor einer „existenzielle Bedrohung“, weil der Chatbot „weitgehend substitutiv“ sei und „immer substitutiver werde, je besser sie werden“.
- OpenAI-Präsident Greg Brockman bezeichnete die Modelle als „exzellent bei Nachrichten“. Nadella bestätigte unter Eid, dass der Chat mit einem Bot den Besuch der Quellwebsite ersetzt.
Kontext
Der Fall läuft seit drei Jahren; Richter neigten bei Fair Use generally eher zu den KI-Unternehmen, und die Trump-Administration reichte diesen Monat ein Schreiben ein, das OpenAIs unlizenziertes Training verteidigt. Einschränkung: Ein Großteil des neuen Materials stammt aus dem eigenen Schriftsatz der Times, nicht aus den zugrunde liegenden versiegelten Anlagen, und die zitierten Passagen werden ohne ihren ursprünglichen Kontext präsentiert. Für Entwickler, die RAG- oder Trainingspipelines betreiben, ist die hier gewonnene Erkenntnis eine Erinnerung daran, dass Datenherkunft und Lizenzbedingungen zunehmend zu Gerichtsbeweisen werden – nicht nur zu einer Frage der Engineering-Hygiene.
📖 Read the full source: HN AI Agents
👀 Siehe auch

AMD Ryzen AI NPUs erhalten Linux-LLM-Unterstützung über Lemonade 10.0 und FastFlowLM
AMD Ryzen AI NPUs unterstützen jetzt das Ausführen großer Sprachmodelle auf Linux über den Lemonade 10.0-Server mit FastFlowLM-Laufzeitumgebung, wobei Linux 7.0-Kernel oder AMDXDNA-Treiber-Backports erforderlich sind.

Claude-Code v2.1.80 fügt Überwachung der Ratenbegrenzung, Verbesserungen an Plugins und Speicheroptimierungen hinzu.
Claude-Code v2.1.80 führt ein rate_limits-Feld für Statusleisten-Skripte zur Anzeige der Claude.ai-Nutzung ein, fügt source: 'settings' für den Plugin-Marktplatz hinzu und reduziert den Speicherverbrauch in großen Repositories um ~80 MB. Das Release behebt auch die Wiederherstellung paralleler Tool-Ergebnisse, WebSocket-Fehler und verschiedene UI-Probleme.

Anthropic startet Fernsteuerung für Claude Code
Anthropic hat eine Fernsteuerungsfunktion für Claude Code eingeführt, die es Nutzern ermöglicht, ihre Codingsitzungen von Mobilgeräten aus fortzusetzen. Die Funktion ist unter code.claude.com/docs/en/remote-control dokumentiert.

Anthropic liefert 1-Million-Token-Kontextfenster für Claude Opus ohne Aufpreis aus.
Anthropic hat das 1-Million-Token-Kontextfenster für alle Claude Code-Benutzer auf Max-, Team- und Enterprise-Tarifen in Version 2.1.75 verfügbar gemacht und die bisherigen zusätzlichen Nutzungsgebühren abgeschafft. Das Standardfenster bleibt bei 200.000 Tokens.