Executivo da Microsoft chamou a raspagem de dados por IA de "o maior roubo de trabalho da história humana", mostram documentos não censurados do processo NYT v. OpenAI

✍️ OpenClawRadar📅 Publicado: September 18, 2026🔗 Source
Ad

Material recém-divulgado sem tarjas no processo de direitos autorais The New York Times v. OpenAI and Microsoft inclui comunicações internas da Microsoft e da OpenAI que enfraquecem a defesa de uso justo das empresas. O TechCrunch informa que o documento afirma que Brent Hecht, diretor de Ciência Aplicada da Microsoft, descreveu em um memorando de janeiro de 2023 a aquisição de dados de treinamento pelas empresas como "um roubo espantoso de proporções sem precedentes" e "o maior roubo de trabalho da história humana".

O que os documentos alegam

  • As empresas supostamente contornaram paywalls sem serem detectadas, criaram conjuntos de dados de treinamento por meio de scraping em massa e removeram avisos de direitos autorais dos dados de treinamento.
  • Somente os conjuntos de dados de treinamento intermediário da OpenAI contêm mais de 91.692 cópias de obras publicadas pelo NYT, pelo Daily News e pelo Center for Investigative Reporting.
  • Um conjunto de dados derivado do Common Crawl incluía mais de 2 milhões de documentos só do nytimes.com.
  • Dados da própria Microsoft mostram que seu "mecanismo de resposta" Copilot reduziu as taxas de cliques para o domínio do NYT em até 93% em comparação com a busca tradicional do Bing.

O documento interno do 'loop da perdição'

Uma apresentação da Microsoft de janeiro de 2024, feita por Hecht, descreveu a queda de tráfego como um "loop da perdição" que "prejudicaria o desempenho dos nossos modelos e de toda a web ao mesmo tempo", e alertou: "É altamente incomum que um produto final ameace as bases econômicas de seus fornecedores essenciais, mas essa é a situação que criamos para nosso negócio de LLM em relação à sua 'cadeia de suprimento de conteúdo'". Um documento separado da Microsoft sinaliza um "risco real" de que a IA generativa possa "perturbar significativamente o emprego justamente das pessoas que geraram os dados com os quais o modelo de fundação foi treinado".

Ad

Declarações que contrariam o uso justo

  • O CEO da Microsoft, Satya Nadella, testemunhou este ano que "qualquer coisa que esteja atrás de paywall deveria ser licenciada por qualquer um que queira usá-la... para ancoragem ou treinamento", e disse que teria exigido que a OpenAI retreinasse se soubesse que ela extraiu dados protegidos por paywall.
  • Nick Turley, chefe do ChatGPT da OpenAI, escreveu internamente que as editoras enfrentam uma "ameaça existencial" porque o chatbot é "em grande parte substitutivo" e "se tornará cada vez mais substitutivo conforme forem melhorando".
  • O presidente da OpenAI, Greg Brockman, descreveu os modelos como "excelentes em notícias". Nadella concordou sob juramento que conversar com um bot substitui a visita ao site de origem.

Contexto

O caso já dura três anos; os juízes geralmente têm se inclinado a favor das empresas de IA no uso justo, e o governo Trump apresentou um parecer neste mês defendendo o treinamento sem licença da OpenAI. Ressalva: grande parte do novo material vem do próprio memorial do The Times, não das provas seladas subjacentes, e os trechos citados são apresentados sem seu contexto original. Para desenvolvedores que implementam RAG ou pipelines de treinamento, a descoberta aqui é um lembrete de que a proveniência dos dados e os termos de licenciamento estão se tornando provas judiciais, não apenas higiene de engenharia.

📖 Leia a fonte completa: HN AI Agents

Ad

👀 See Also

A quantização Q8_0 do llama.cpp obtém uma aceleração de 3,1x em GPUs Intel Arc com a correção de reordenação SYCL.
News

A quantização Q8_0 do llama.cpp obtém uma aceleração de 3,1x em GPUs Intel Arc com a correção de reordenação SYCL.

Uma correção no backend SYCL do llama.cpp leva a quantização Q8_0 em GPUs Intel Arc de 21% para 66% da largura de banda teórica de memória, alcançando 15,24 tokens/segundo contra 4,88 tokens/segundo anteriormente em uma Arc Pro B70 com Qwen3.5-27B.

OpenClawRadar
Usuário do Reddit propõe recurso de timestamp para Claude para abordar lacuna de consciência temporal
News

Usuário do Reddit propõe recurso de timestamp para Claude para abordar lacuna de consciência temporal

Um usuário do Reddit identifica a falta de consciência temporal do Claude como uma limitação para casos de uso de produtividade e propõe um recurso opcional de registro de data e hora que marcaria cada resposta com data e hora, persistente entre sessões.

OpenClawRadar
Claude-Code v2.1.91 adiciona persistência de resultados MCP, controles de execução de shell e deep links multilinha
News

Claude-Code v2.1.91 adiciona persistência de resultados MCP, controles de execução de shell e deep links multilinha

Claude-Code v2.1.91 introduz a substituição de persistência de resultados de ferramentas MCP via anotação _meta["anthropic/maxResultSizeChars"] suportando até 500 mil caracteres, adiciona a configuração disableSkillShellExecution e habilita prompts de múltiplas linhas em deep links claude-cli://open?q= com novas linhas codificadas.

OpenClawRadar
Google doa Protocolo de Pagamento de Agentes (AP2) para a FIDO Alliance, lança v0.2 com pagamentos 'Humano Não Presente'
News

Google doa Protocolo de Pagamento de Agentes (AP2) para a FIDO Alliance, lança v0.2 com pagamentos 'Humano Não Presente'

O Google está doando o Agent Payments Protocol (AP2) para a FIDO Alliance e lançando a v0.2 com suporte para pagamentos autônomos 'Human Not Present' e um novo padrão de Intenção Verificável, desenvolvido em conjunto com a Mastercard.

OpenClawRadar