Руководитель Microsoft назвал сбор данных ИИ «крупнейшей кражей труда в истории человечества», показывают неотредактированные материалы дела NYT против OpenAI
В недавно рассекреченных материалах судебного иска The New York Times против OpenAI и Microsoft о нарушении авторских прав содержатся внутренние коммуникации Microsoft и OpenAI, которые подрывают защиту компаний на основании добросовестного использования. Как сообщает TechCrunch, в материалах дела указано, что директор Microsoft по прикладной науке Брент Хехт в служебной записке от января 2023 года описал сбор обучающих данных компаниями как «ошеломляющую кражу беспрецедентных масштабов» и «крупнейшую кражу труда в истории человечества».
Что утверждается в материалах дела
- Компании, как утверждается, незаметно обходили платные барьеры, создавали наборы обучающих данных путём массового скрейпинга и удаляли уведомления об авторских правах из обучающих данных.
- Только промежуточные наборы данных OpenAI содержат более 91 692 копий произведений, опубликованных NYT, Daily News и Center for Investigative Reporting.
- Набор данных, производный от Common Crawl, включал более 2 миллионов документов только с сайта nytimes.com.
- Собственные данные Microsoft показывают, что её «движок ответов» Copilot снизил коэффициент кликабельности для домена NYT на целых 93% по сравнению с традиционным поиском Bing.
Внутренний документ о «цикле гибели»
В презентации Microsoft, подготовленной Хехтом в январе 2024 года, падение трафика описывалось как «цикл гибели», который «ухудшит работу наших моделей и всей сети одновременно», и содержалось предупреждение: «Крайне необычно, когда конечный продукт угрожает экономическим основам своих ключевых поставщиков, но именно такую ситуацию мы создали для нашего бизнеса LLM в отношении его „цепочки поставок контента“». В отдельном документе Microsoft отмечается «реальный риск» того, что генеративный ИИ может «значительно нарушить занятость тех самых людей, которые создали данные, на которых обучалась базовая модель».
Заявления, противоречащие добросовестному использованию
- Генеральный директор Microsoft Сатья Наделла в этом году дал показания, что «всё, что находится за платной стеной, должно лицензироваться любым, кто хочет использовать это… для заземления или обучения», и заявил, что потребовал бы от OpenAI провести переобучение, если бы знал, что она скрейпила данные из-за платных стен.
- Руководитель ChatGPT в OpenAI Ник Тёрли во внутренней переписке написал, что издатели сталкиваются с «экзистенциальной угрозой», поскольку чат-бот «в значительной степени заменяет» их и «будет заменять всё больше по мере совершенствования».
- Президент OpenAI Грег Брокман описал модели как «отлично разбирающиеся в новостях». Наделла под присягой согласился, что общение с ботом заменяет посещение сайта-источника.
Контекст
Дело рассматривается уже три года; судьи в целом склонялись на сторону ИИ-компаний в вопросах добросовестного использования, а администрация Трампа в этом месяце подала заключение в защиту обучения OpenAI без лицензий. Оговорка: значительная часть новых материалов взята из собственного заключения The Times, а не из лежащих в основе закрытых доказательств, и процитированные фрагменты приводятся без их исходного контекста. Для разработчиков, внедряющих RAG или конвейеры обучения, обнаруженные здесь сведения — напоминание о том, что происхождение данных и условия лицензирования становятся доказательствами в суде, а не просто частью инженерной гигиены.
📖 Читайте полный источник: HN AI Agents
👀 Смотрите также

Claude-Code v2.1.41 Выпуск: Основные обновления и исправления
Claude-Code v2.1.41 представляет улучшения обновления AWS auth, поддержку Windows ARM64 и исправления различных инструментов и элементов пользовательского интерфейса.

ИИ-модели не обладают самосознанием в отношении собственных инструментов и пользовательского интерфейса.
ИИ-модели, такие как ChatGPT и Claude, часто предоставляют неверную или устаревшую информацию о собственных функциях и интерфейсах, например, отрицают существование новых слеш-команд или описывают старые версии интерфейса, поскольку они обучены на прошлых снимках данных, в то время как продукты постоянно развиваются.

Обновления Claude Code v2.1.91: Шаблоны проектирования агентов, правила памяти и улучшения инструментов
Claude Code v2.1.91 добавляет справочное руководство по шаблонам проектирования агентов, охватывающее дизайн интерфейса инструментов, управление контекстом и стратегии кэширования. Обновление упрощает правила выбора памяти, добавляет мониторинг безопасности для отравления памяти и улучшает описания инструментов для операций Edit, ReadFile и Write.

OpenAI及其竞争对手发布智能体插件:一种适用于AI代理的包格式
OpenAI, Amazon, Microsoft, Cursor и Vercel выпустили Agent Plugins 1.0 — открытый стандарт для упаковки расширений для ИИ-агентов. Создайте один раз, работайте в ChatGPT, Codex, Copilot, Cursor и других.