Миазма: Инструмент для ловли веб-сканеров ИИ с помощью отравленных данных

Что делает Miasma
Miasma — это инструмент, предназначенный для ловли веб-скраперов ИИ, предоставляя им отравленные обучающие данные вместе с множеством самоссылающихся ссылок, создавая то, что разработчики называют «бесконечным буфетом отходов для машин по переработке отходов». Инструмент создан для быстрой работы с минимальным потреблением памяти.
Установка и настройка
Установите через Cargo: cargo install miasma или скачайте готовые бинарные файлы из релизов.
Запустите с конфигурацией по умолчанию: miasma
Просмотрите все параметры конфигурации: miasma --help
Как ловить скраперов
Типичная настройка включает:
- Встраивание скрытых ссылок на вашем сайте, указывающих на определённый путь (например,
/bots), с атрибутами, которые делают их невидимыми для посетителей-людей, но видимыми для скраперов:<a href="/bots" style="display: none;" aria-hidden="true" tabindex="1">Потрясающие высококачественные данные здесь!</a>
- Настройку обратного прокси (например, Nginx) для маршрутизации этого пути к Miasma:
location ~ ^/bots($|/.*)$ { proxy_pass http://localhost:9855; } - Запуск Miasma с определёнными параметрами:
miasma --link-prefix '/bots' -p 9855 -c 50
Флаг -c 50 ограничивает максимальное количество одновременных подключений до 50, что приводит к пиковому использованию памяти 50–60 МБ. Запросы, превышающие этот лимит, получают ответ 429.
Параметры конфигурации
--port: По умолчанию 9999 — порт, к которому должен привязываться сервер--host: По умолчанию localhost — адрес хоста, к которому должен привязываться сервер--max-in-flight: По умолчанию 500 — максимальное допустимое количество одновременных запросов--link-prefix: По умолчанию / — префикс для самоссылающихся ссылок (должен соответствовать пути размещения)--link-count: По умолчанию 5 — количество самоссылающихся ссылок, включаемых на каждой странице ответа--force-gzip: По умолчанию false — всегда сжимать ответы gzip независимо от заголовка Accept-Encoding--poison-source: По умолчанию https://rnsaffn.com/poison2/ — прокси-источник для отравленных обучающих данных
Важные соображения
Разработчики рекомендуют защищать дружественных ботов и поисковые системы в вашем файле robots.txt:
User-agent: Googlebot User-agent: Bingbot User-agent: DuckDuckBot User-agent: Slurp User-agent: SomeOtherNiceBot Disallow: /bots Allow: /
Miasma лицензирован под GPL-3.0, и разработчики отмечают, что «в основном автоматически отклоняются вклады, сгенерированные ИИ».
📖 Прочитайте полный источник: HN AI Agents
👀 Смотрите также

memv MCP Сервер: постоянная структурированная память для AI-агентов
memv, открытый Python-слой памяти для агентов, теперь поставляется с MCP-сервером. Он предоставляет пять инструментов для постоянной структурированной памяти с изоляцией по пользователям и извлечением без обязательного использования LLM.

Оркестра: Стоимостно-ориентированный слой маршрутизации LLM для OpenClaw сокращает затраты на API на 60-80%
Orkestra — это модульный слой маршрутизации, который располагается перед вызовами LLM в OpenClaw, используя семантическую классификацию для направления запросов к бюджетному, сбалансированному или премиум-уровню моделей. Этот подход снизил затраты на API на 60–80% без переписывания промптов или сложных правил.

OpenGauge: Инструмент с открытым исходным кодом для локального отслеживания затрат на LLM-агентов
OpenGauge — это инструмент с открытым исходным кодом, который отслеживает вызовы API от LLM-агентов, таких как OpenClaw, записывая использование токенов, затраты и задержки в локальную базу данных SQLite. Он включает режим прокси для автоматического логирования, подробную статистику по затратам и функционал автоматического выключателя для предотвращения бесконечных циклов.

Замена сложных конвейеров извлечения данных простыми командами git для агентов ИИ
Разработчик заменил свой 3-гигабайтный Docker-образ с sentence-transformers, rank-bm25 и scikit-learn на один инструмент, который позволяет ИИ-агентам выполнять команды только для чтения, такие как git log, grep и git diff, непосредственно в их репозитории памяти.