CrabMeat v0.1.0: безопасный шлюз для агентов, не доверяющий LLM контроль безопасности

CrabMeat v0.1.0 вышел вчера под лицензией Apache 2.0, основанный на одном тезисе: LLM никогда не удерживает границу безопасности. Проект — прямой ответ на такие провалы, как удаление агентом Summer Yue более 200 писем, когда инструкция безопасности была промптом, который был сжат.
Ключевые защиты (всегда включены, без настройки)
- Косвенная адресация через идентификаторы возможностей — Модель видит непрозрачные идентификаторы на основе HMAC для каждой сессии, например
cap_a4f9e2b71c83, никогда не видя реальных имён инструментов. Она не может угадать или подделать имя инструмента, поскольку не знает ни одного. - Классы эффектов — Каждый инструмент объявляет класс (
read,write,exec,network). Каждый агент объявляет, какие классы он может использовать. Проверка — это чистая функция без состояния выполнения, её легко тщательно протестировать и сложно обойти. - IRONCLAD_CONTEXT — Критические инструкции безопасности закрепляются в верхней части контекстного окна и явно помечаются как не подлежащие сжатию. Невозможен режим отказа при сжатии, который удалил инструкцию Yue.
- Аудиторская цепочка с защитой от изменений — Каждый вызов инструмента, привилегированная операция и запуск планировщика попадают в журнал с хэш-цепочкой SHA-256. Факт подделки доказуем.
- Фильтр утечек потокового вывода — Секреты (ключи API, JWT, PEM-блоки, идентификаторы возможностей) удаляются в потоке на границах токенов до того, как достигнут клиента.
- Отсутствие режима YOLO — Нет глобального переключателя "доверять LLM во всём". Расширение доступа происходит через именованные ограниченные корни, которые явны, аудируются и ограничены.
В README представлена таблица из 15 всегда включенных защит; ни одна из них не может быть отключена через конфигурацию. Шлюз по умолчанию работает локально, настроен для Ollama, LM Studio, vLLM из коробки. Anthropic и OpenAI требуют явной конфигурации — никакой скрытной отправки в облако.
Для кого это
Разработчики, создающие агентные системы, которым нужны архитектурные гарантии, а не безопасность на основе промптов, и которые хотят шлюз, которому можно доверять выполнение инструментов и работу с конфиденциальными данными.
📖 Источник: r/ClaudeAI
👀 Смотрите также

Фабрика агентов: Плагин Claude Code для создания постоянных команд AI-субагентов
Agent-factory — это плагин Claude Code, который создает постоянные команды под-агентов с различными личностями и файловой памятью. Он формирует 2-5 агентов на проект через диалоговое интервью, где каждый агент выполняет определенные роли, такие как ревью кода, отслеживание технического долга или стратегия.

Сервер MCP для данных о поездах в Италии: задержки в реальном времени, отправления и расписания в Claude
Разработчик создал неофициальный MCP-сервер для Trenitalia, который предоставляет пять инструментов для запроса данных об итальянских поездах через Claude, включая табло отправлений/прибытий в реальном времени, отслеживание поездов и расписания с обогащением данными о задержках.

Voxlert: Голосовые уведомления для сессий Claude Code с голосами персонажей
Voxlert — это инструмент, который подключается к событиям Claude Code и озвучивает уведомления с помощью характерных голосов, таких как адъютант из StarCraft, SHODAN, GLaDOS и костюм HEV. Он использует LLM через OpenRouter для генерации реплик в стиле персонажей и работает локально после установки через npm.

Экранбокс: Открытый код виртуальных рабочих столов для ИИ-агентов, полностью созданных голосом
Screenbox предоставляет изолированные Linux-рабочие столы в Docker для AI-агентов, решая конфликты при параллельном запуске нескольких агентов. Проект был полностью создан с помощью голосовых команд в Claude Code, и создатель не видел ни одной строки кода.