Угроза блокировки Internet Archive ставит под угрозу сохранение истории веб-пространства.

Что происходит с доступом к Internet Archive
The New York Times начала блокировать Internet Archive от сканирования своего веб-сайта с помощью технических мер, выходящих за рамки традиционных правил robots.txt. Другие газеты, включая The Guardian, похоже, следуют этому подходу. Такая блокировка рискует лишить доступа к историческим веб-записям, на которые десятилетиями полагались журналисты, исследователи и суды.
Почему это важно для исторического сохранения
Internet Archive управляет Wayback Machine, которая содержит более одного триллиона сохранённых веб-страниц. Почти тридцать лет она сохраняет новостные сайты в их первоначальном онлайн-виде. Когда статьи редактируются, изменяются или удаляются, Архив часто становится единственным источником для просмотра этих оригинальных версий. Блокировка этих краулеров крупными издателями означает, что историческая запись начинает исчезать.
Связь с ИИ и правовой контекст
Издатели ссылаются на опасения по поводу скрапинга новостного контента компаниями ИИ как на мотивацию для блокировки Архива. The New York Times и другие подают в суд на компании ИИ по вопросу о том, нарушает ли закон обучение моделей на защищённом авторским правом материале. Однако Internet Archive не создаёт коммерческие системы ИИ — она сохраняет исторические записи. В статье утверждается, что блокировка некоммерческих архивистов — это неправильная реакция на опасения по поводу обучения ИИ.
С правовой точки зрения, обеспечение возможности поиска материала является устоявшимся добросовестным использованием. Суды признали, что создание поисковых индексов часто требует создания копий исходного материала. Когда Google скопировал целые книги для создания поисковой базы данных, суды признали это добросовестным использованием, поскольку это служило преобразовательной цели — обеспечению обнаружения и исследований. Те же принципы применимы к веб-архивированию.
Практическое влияние на исследования и журналистику
Только Wikipedia ссылается на более чем 2,6 миллиона новостных статей, сохранённых в Internet Archive, охватывающих 249 языков. Бесчисленные блогеры, исследователи и репортёры зависят от Архива как от стабильного, авторитетного свидетельства того, что было опубликовано в сети. Если крупные издатели продолжат блокировать доступ, будущие исследователи могут обнаружить, что значительные части веб-истории исчезли.
📖 Прочитать полный источник: HN AI Agents
👀 Смотрите также
Debian голосует по политике вкладов в ИИ/LLM: что нужно знать разработчикам
Проект Debian начал голосование о будущем вкладов ИИ/LLM. Исход определит, как обрабатывать код, созданный ИИ, в пакетах Debian.

Claude Code v2.1.128: изоляция OTEL, исправления MCP, поддержка плагинов .zip и более 20 исправлений ошибок
Claude Code v2.1.128 предотвращает наследование переменных окружения OTEL_* дочерними процессами, добавляет поддержку плагинов .zip, исправляет лавинообразные переподключения MCP и отмену параллельных вызовов shell-инструментов.

Обновление статуса Claude: Повышенный уровень ошибок для Opus 4.6 и Sonnet 4.6
Официальное обновление статуса системы Claude сообщает о повышенном уровне ошибок для моделей Opus 4.6 и Sonnet 4.6, с инцидентом, датированным 2026-03-31T21:10:28.000Z. Автоматическое сообщение направляет пользователей на проверку статуса решения проблемы и отчетов о производительности сообщества.

Anthropic разъясняет политику использования CLI Claude для интеграции с OpenClaw
Anthropic подтвердила, что использование Claude CLI в стиле OpenClaw снова разрешено, что позволяет разработчикам напрямую повторно использовать существующие логины Claude CLI. В документации подробно описаны методы аутентификации как по API-ключу, так и через CLI, а также параметры конфигурации для моделей Claude 4.6, быстрого режима и кэширования промптов.