La Menace de Blocage de l'Internet Archive Met en Péril la Préservation de l'Histoire du Web

Ce qui se passe avec l'accès à l'Internet Archive
The New York Times a commencé à bloquer l'Internet Archive pour l'exploration de son site web en utilisant des mesures techniques qui vont au-delà des règles traditionnelles du fichier robots.txt. D'autres journaux, dont The Guardian, semblent suivre cette approche. Ce blocage risque de couper l'accès aux archives historiques du web sur lesquelles les journalistes, les chercheurs et les tribunaux se sont appuyés pendant des décennies.
Pourquoi cela compte pour la préservation historique
L'Internet Archive exploite la Wayback Machine, qui contient plus d'un billion de pages web archivées. Depuis près de trente ans, elle préserve les sites d'actualités tels qu'ils sont apparus à l'origine en ligne. Lorsque des articles sont modifiés, changés ou supprimés, l'Archive devient souvent la seule source pour voir ces versions originales. Le blocage de ces robots d'exploration par les grands éditeurs signifie que les archives historiques commencent à disparaître.
Le lien avec l'IA et le contexte juridique
Les éditeurs citent des préoccupations concernant le scraping de contenu d'actualité par des entreprises d'IA comme motivation pour bloquer l'Archive. The New York Times et d'autres poursuivent en justice des entreprises d'IA pour savoir si l'entraînement de modèles sur du matériel protégé par le droit d'auteur viole la loi. Cependant, l'Internet Archive ne construit pas de systèmes d'IA commerciaux – elle préserve des archives historiques. L'article soutient que bloquer les archivistes à but non lucratif est une mauvaise réponse aux préoccupations concernant l'entraînement de l'IA.
D'un point de vue juridique, rendre du matériel consultable est un usage équitable établi. Les tribunaux ont reconnu que la construction d'index consultables nécessite souvent de faire des copies du matériel sous-jacent. Lorsque Google a copié des livres entiers pour créer une base de données consultable, les tribunaux ont reconnu cela comme un usage équitable car cela servait l'objectif transformateur de permettre la découverte et la recherche. Les mêmes principes s'appliquent à l'archivage web.
Impact pratique sur la recherche et le journalisme
Wikipédia à lui seul renvoie à plus de 2,6 millions d'articles de presse préservés à l'Internet Archive, couvrant 249 langues. D'innombrables blogueurs, chercheurs et journalistes dépendent de l'Archive comme un enregistrement stable et fiable de ce qui a été publié en ligne. Si les grands éditeurs continuent de bloquer l'accès, les futurs chercheurs pourraient constater que des portions significatives de l'histoire du web ont disparu.
📖 Read the full source: HN AI Agents
👀 See Also

Stratégie commerciale d'Anthropic : Les revenus de l'API motivent les limitations du service grand public
Les abonnements grand public d'Anthropic fonctionnent à perte, subventionnés pour développer la notoriété de l'IA, tandis que leur activité API génère des revenus. Le niveau Pro à 20 $ est intentionnellement limité pour orienter les utilisateurs vers les abonnements Max à plus forte valeur.

Anthropic lance le programme des ambassadeurs de la communauté Claude
Anthropic a lancé le programme Claude Community Ambassadors, qui fournit des ressources pour organiser des rencontres locales de développeurs et connecter les créateurs du monde entier. Le programme est ouvert aux participants de tous horizons et de toutes localisations.

Comparaison actuelle des coûts des LLM : Deepseek, Qwen, MiniMax vs OpenAI
Une analyse Reddit montre que Deepseek-V3.2 à 0,26$/0,38$ par million de tokens est environ 10 fois moins cher que GPT-4 tout en offrant des performances de classe GPT-5 selon les benchmarks, avec Qwen3.5 et MiniMax-M2.5 comme alternatives compétitives à Claude et OpenAI.

Exploration de Step 3.5 Flash : Modèle Open-Source pour un Raisonnement Profond Rapide
Step 3.5 Flash est un modèle de base open-source conçu pour un raisonnement profond rapide et efficace, utilisant une architecture éparse de Mélange d'Experts.