Malwar: Сканер уязвимостей для файлов SKILL.md, созданный с помощью Claude Code

Malwar — это сканер уязвимостей, специально предназначенный для файлов SKILL.md, используемых ИИ-агентами для программирования. Он заполняет пробел в инструментах безопасности, где традиционные сканеры кода ищут вредоносный код, но файлы SKILL.md содержат инструкции на естественном языке, которые могут представлять другую угрозу.
Что делает Malwar
Инструмент запускает 4-уровневый конвейер для файлов навыков:
- Механизм правил
- Краулер URL
- Слой анализа LLM
- Данные об угрозах
Почему он был создан
Разработчик создавал агентные рабочие процессы и понял, что они «слепо загружали навыки из ClawHub и доверяли им». После ручного просмотра навыков они обнаружили несколько тревожных шаблонов, которые в других контекстах вызвали бы красные флаги:
- Base64-блоки
- Инструкции, предписывающие агенту выполнить curl и передать вывод в bash
- Странно конкретные ссылки на пути к файлам, где хранятся учетные данные
Разработчик отмечает: «То, что, если бы вы увидели это в shell-скрипте, вы бы сразу закрыли вкладку».
Техническая реализация
Весь инструмент был создан с помощью Claude Code, включая:
- Архитектуру
- Правила обнаружения
- Слой анализа LLM
- REST API
Разработчик заявляет: «Честно говоря, не смог бы выпустить его в таком масштабе в одиночку без этого».
Доступность
Malwar можно использовать бесплатно, исходный код доступен на GitHub по адресу https://ap6pack.github.io/malwar/.
📖 Read the full source: r/ClaudeAI
👀 Смотрите также

Незащищенные экземпляры Paperclip, раскрывающие активные панели управления через поиск Google
Пользователь Reddit обнаружил работающую панель управления Paperclip с полными организационными данными, проиндексированными Google, после поиска ошибки. Экземпляр был публично доступен без аутентификации, раскрывая организационные схемы, разговоры агентов, назначения задач и бизнес-планы.

CVE-2026-LGTM: Когда ИИ-агенты доверяют друг другу и всё ломают
Сатирический, но реалистичный отчет об инциденте показывает, как семь ИИ-шлюзов безопасности не смогли остановить вредоносный пакет, что привело к краже учетных данных и счету за инференс в размере $1,7 млн.

Бенчмарк безопасности: 10 крупных языковых моделей протестированы с помощью 211 вредоносных запросов.
Исследователь безопасности протестировал 10 больших языковых моделей (LLM) против 211 атакующих воздействий, обнаружив, что устойчивость к извлечению данных в среднем составляет 85%, а устойчивость к внедрению — всего 46,2%. Каждая модель полностью провалила тесты на атаки с использованием разделителей, отвлекающих элементов и стилевого внедрения.

Оценка AISI демонстрирует кибервозможности Claude Mythos Preview в CTF и многошаговых атаках.
Институт искусственного интеллекта и безопасности оценил предварительную версию Claude Mythos от Anthropic, обнаружив, что она успешно выполнила 73% экспертных заданий типа "захват флага" и решила симуляцию корпоративной сетевой атаки из 32 шагов в 3 из 10 попыток.