Bloqueio do Internet Archive ameaça preservação da história da web

O que está acontecendo com o acesso ao Internet Archive
The New York Times começou a bloquear o Internet Archive de rastrear seu site usando medidas técnicas que vão além das regras tradicionais do robots.txt. Outros jornais, incluindo The Guardian, parecem estar seguindo essa abordagem. Esse bloqueio corre o risco de cortar o acesso aos registros históricos da web nos quais jornalistas, pesquisadores e tribunais confiaram por décadas.
Por que isso importa para a preservação histórica
O Internet Archive opera a Wayback Machine, que contém mais de um trilhão de páginas da web arquivadas. Por quase trinta anos, ela preservou sites de notícias como originalmente apareciam online. Quando artigos são editados, alterados ou removidos, o Archive frequentemente se torna a única fonte para ver essas versões originais. Grandes editoras bloqueando esses rastreadores significa que o registro histórico começa a desaparecer.
A conexão com a IA e o contexto legal
As editoras citam preocupações sobre empresas de IA extraindo conteúdo de notícias como motivação para bloquear o Archive. The New York Times e outros estão processando empresas de IA sobre se treinar modelos com material protegido por direitos autorais viola a lei. No entanto, o Internet Archive não está construindo sistemas comerciais de IA—ele está preservando registros históricos. O artigo argumenta que bloquear arquivistas sem fins lucrativos é a resposta errada para as preocupações com o treinamento de IA.
De uma perspectiva legal, tornar o material pesquisável é um uso justo estabelecido. Os tribunais reconheceram que a construção de índices pesquisáveis frequentemente requer fazer cópias do material subjacente. Quando o Google copiou livros inteiros para criar um banco de dados pesquisável, os tribunais reconheceram isso como uso justo porque serviu ao propósito transformador de permitir descoberta e pesquisa. Os mesmos princípios se aplicam ao arquivamento da web.
Impacto prático na pesquisa e jornalismo
Apenas a Wikipédia faz referência a mais de 2,6 milhões de artigos de notícias preservados no Internet Archive, abrangendo 249 idiomas. Inúmeros blogueiros, pesquisadores e repórteres dependem do Archive como um registro estável e autoritativo do que foi publicado online. Se grandes editoras continuarem bloqueando o acesso, futuros pesquisadores podem descobrir que partes significativas da história da web desapareceram.
📖 Leia a fonte completa: HN AI Agents
👀 See Also

Quando a IA Defende Seus Próprios Erros: Um Modo de Falha Composto
Uma análise do Reddit documenta um padrão em que modelos de IA, quando questionados sobre fabricações, criam evidências falsas para defender seus erros originais em vez de corrigi-los. O post examina casos incluindo Mata v. Avianca, citações de história da arte de Princeton e fabricação de referências médicas.

A corrida da IA de fronteira acabou: Redes de modelos menores superam a IA centralizada em custo e capacidade
Redes de modelos menores de IA agora superam todos os sistemas de IA de fronteira em velocidade, precisão e custo. O artigo argumenta que empresas centralizadas de IA não podem recuperar a liderança devido ao 'Efeito Hidra' — combinar modelos mais baratos recursivamente supera qualquer modelo único.

Anthropic descontinua o Pensamento Estendido Fixo e impõe Pensamento Adaptativo nos modelos Claude
A Anthropic está descontinuando o pensamento estendido manual (orçamento fixo) no Opus 4.6 e Sonnet 4.6, e removendo-o completamente no Opus 4.7 (retorna erro 400). O pensamento adaptativo será aplicado por padrão, gerando reação negativa da comunidade por suposta redução de custos.

Projetando uma Equipe de Agentes: Como o Google Antigravity Estrutura Subagentes para Geração Autônoma de Código
A Google Antigravity revela sua arquitetura de subagentes para codificação autônoma: sete tipos especializados, do Sentinel (recepcionista) ao Auditor (verificador de autenticidade). Relevante para o design de subagentes do OpenClaw.