CrabMeat v0.1.0: безопасный шлюз для агентов, не доверяющий LLM контроль безопасности

CrabMeat v0.1.0 вышел вчера под лицензией Apache 2.0, основанный на одном тезисе: LLM никогда не удерживает границу безопасности. Проект — прямой ответ на такие провалы, как удаление агентом Summer Yue более 200 писем, когда инструкция безопасности была промптом, который был сжат.
Ключевые защиты (всегда включены, без настройки)
- Косвенная адресация через идентификаторы возможностей — Модель видит непрозрачные идентификаторы на основе HMAC для каждой сессии, например
cap_a4f9e2b71c83, никогда не видя реальных имён инструментов. Она не может угадать или подделать имя инструмента, поскольку не знает ни одного. - Классы эффектов — Каждый инструмент объявляет класс (
read,write,exec,network). Каждый агент объявляет, какие классы он может использовать. Проверка — это чистая функция без состояния выполнения, её легко тщательно протестировать и сложно обойти. - IRONCLAD_CONTEXT — Критические инструкции безопасности закрепляются в верхней части контекстного окна и явно помечаются как не подлежащие сжатию. Невозможен режим отказа при сжатии, который удалил инструкцию Yue.
- Аудиторская цепочка с защитой от изменений — Каждый вызов инструмента, привилегированная операция и запуск планировщика попадают в журнал с хэш-цепочкой SHA-256. Факт подделки доказуем.
- Фильтр утечек потокового вывода — Секреты (ключи API, JWT, PEM-блоки, идентификаторы возможностей) удаляются в потоке на границах токенов до того, как достигнут клиента.
- Отсутствие режима YOLO — Нет глобального переключателя "доверять LLM во всём". Расширение доступа происходит через именованные ограниченные корни, которые явны, аудируются и ограничены.
В README представлена таблица из 15 всегда включенных защит; ни одна из них не может быть отключена через конфигурацию. Шлюз по умолчанию работает локально, настроен для Ollama, LM Studio, vLLM из коробки. Anthropic и OpenAI требуют явной конфигурации — никакой скрытной отправки в облако.
Для кого это
Разработчики, создающие агентные системы, которым нужны архитектурные гарантии, а не безопасность на основе промптов, и которые хотят шлюз, которому можно доверять выполнение инструментов и работу с конфиденциальными данными.
📖 Источник: r/ClaudeAI
👀 Смотрите также

Бенчмарк проверки кода ИИ: сравнение Claude, Gemini, Codex, Qwen и MiniMax
В ходе тестирования пять моделей ИИ были протестированы на 15 пулл-реквестах Milvus с известными багами. Claude обнаружил 53% багов в режиме raw, в то время как состязательные дебаты между моделями увеличили обнаружение до 80%.

Улучшитель промптов Claude Code v0.5.3: Рефакторинг режима планирования и исследование на основе субагентов
v0.5.3 добавляет хук PreToolUse для читаемости режима планирования (чистые перезаписи, без истории решений) и переносит исследование нечётких запросов в подагенты Task/Explore на Haiku для экономии токенов основного контекста. Плагин теперь работает на Windows и имеет более 1,4K звёзд на GitHub.

ClaudyBro: Нативный терминал macOS для рабочих процессов кода Claude
ClaudyBro — это нативное приложение для терминала macOS размером 3,5 МБ, созданное специально для пользователей Claude Code. Оно включает вставку изображений, инспектор процессов, очистку «осиротевших» процессов и интеллектуальное управление MCP. В простое потребляет 68 МБ оперативной памяти, а при работе Claude — 82 МБ.

Сравнительный обзор быстрого вывода LLM от Anthropic и OpenAI
Антропик и OpenAI недавно представили функции 'быстрого режима', чтобы повысить скорость вывода своих языковых моделей.