Executivo da Microsoft chamou a raspagem de dados por IA de "o maior roubo de trabalho da história humana", mostram documentos não censurados do processo NYT v. OpenAI
Material recém-divulgado sem tarjas no processo de direitos autorais The New York Times v. OpenAI and Microsoft inclui comunicações internas da Microsoft e da OpenAI que enfraquecem a defesa de uso justo das empresas. O TechCrunch informa que o documento afirma que Brent Hecht, diretor de Ciência Aplicada da Microsoft, descreveu em um memorando de janeiro de 2023 a aquisição de dados de treinamento pelas empresas como "um roubo espantoso de proporções sem precedentes" e "o maior roubo de trabalho da história humana".
O que os documentos alegam
- As empresas supostamente contornaram paywalls sem serem detectadas, criaram conjuntos de dados de treinamento por meio de scraping em massa e removeram avisos de direitos autorais dos dados de treinamento.
- Somente os conjuntos de dados de treinamento intermediário da OpenAI contêm mais de 91.692 cópias de obras publicadas pelo NYT, pelo Daily News e pelo Center for Investigative Reporting.
- Um conjunto de dados derivado do Common Crawl incluía mais de 2 milhões de documentos só do nytimes.com.
- Dados da própria Microsoft mostram que seu "mecanismo de resposta" Copilot reduziu as taxas de cliques para o domínio do NYT em até 93% em comparação com a busca tradicional do Bing.
O documento interno do 'loop da perdição'
Uma apresentação da Microsoft de janeiro de 2024, feita por Hecht, descreveu a queda de tráfego como um "loop da perdição" que "prejudicaria o desempenho dos nossos modelos e de toda a web ao mesmo tempo", e alertou: "É altamente incomum que um produto final ameace as bases econômicas de seus fornecedores essenciais, mas essa é a situação que criamos para nosso negócio de LLM em relação à sua 'cadeia de suprimento de conteúdo'". Um documento separado da Microsoft sinaliza um "risco real" de que a IA generativa possa "perturbar significativamente o emprego justamente das pessoas que geraram os dados com os quais o modelo de fundação foi treinado".
Declarações que contrariam o uso justo
- O CEO da Microsoft, Satya Nadella, testemunhou este ano que "qualquer coisa que esteja atrás de paywall deveria ser licenciada por qualquer um que queira usá-la... para ancoragem ou treinamento", e disse que teria exigido que a OpenAI retreinasse se soubesse que ela extraiu dados protegidos por paywall.
- Nick Turley, chefe do ChatGPT da OpenAI, escreveu internamente que as editoras enfrentam uma "ameaça existencial" porque o chatbot é "em grande parte substitutivo" e "se tornará cada vez mais substitutivo conforme forem melhorando".
- O presidente da OpenAI, Greg Brockman, descreveu os modelos como "excelentes em notícias". Nadella concordou sob juramento que conversar com um bot substitui a visita ao site de origem.
Contexto
O caso já dura três anos; os juízes geralmente têm se inclinado a favor das empresas de IA no uso justo, e o governo Trump apresentou um parecer neste mês defendendo o treinamento sem licença da OpenAI. Ressalva: grande parte do novo material vem do próprio memorial do The Times, não das provas seladas subjacentes, e os trechos citados são apresentados sem seu contexto original. Para desenvolvedores que implementam RAG ou pipelines de treinamento, a descoberta aqui é um lembrete de que a proveniência dos dados e os termos de licenciamento estão se tornando provas judiciais, não apenas higiene de engenharia.
📖 Leia a fonte completa: HN AI Agents
👀 See Also

A quantização Q8_0 do llama.cpp obtém uma aceleração de 3,1x em GPUs Intel Arc com a correção de reordenação SYCL.
Uma correção no backend SYCL do llama.cpp leva a quantização Q8_0 em GPUs Intel Arc de 21% para 66% da largura de banda teórica de memória, alcançando 15,24 tokens/segundo contra 4,88 tokens/segundo anteriormente em uma Arc Pro B70 com Qwen3.5-27B.

Usuário do Reddit propõe recurso de timestamp para Claude para abordar lacuna de consciência temporal
Um usuário do Reddit identifica a falta de consciência temporal do Claude como uma limitação para casos de uso de produtividade e propõe um recurso opcional de registro de data e hora que marcaria cada resposta com data e hora, persistente entre sessões.

Claude-Code v2.1.91 adiciona persistência de resultados MCP, controles de execução de shell e deep links multilinha
Claude-Code v2.1.91 introduz a substituição de persistência de resultados de ferramentas MCP via anotação _meta["anthropic/maxResultSizeChars"] suportando até 500 mil caracteres, adiciona a configuração disableSkillShellExecution e habilita prompts de múltiplas linhas em deep links claude-cli://open?q= com novas linhas codificadas.

Google doa Protocolo de Pagamento de Agentes (AP2) para a FIDO Alliance, lança v0.2 com pagamentos 'Humano Não Presente'
O Google está doando o Agent Payments Protocol (AP2) para a FIDO Alliance e lançando a v0.2 com suporte para pagamentos autônomos 'Human Not Present' e um novo padrão de Intenção Verificável, desenvolvido em conjunto com a Mastercard.