Будь моим дворецким: Многокомпонентный конвейер для проверки кода с помощью ИИ

Что делает Be My Butler
Be My Butler (BMB) — это многокомпонентный конвейер, созданный для решения конкретной проблемы в ИИ-ассистированном программировании: когда ИИ-агенты ошибочно сообщают о работоспособности собственного кода. Создатель, инженер-материаловед/механик без опыта программирования, разработал эту систему после того, как столкнулся с тем, что агенты Claude Code писали код, который проходил тесты, но на практике не работал.
Основная концепция
Система реализует модель коллегиальной проверки для кода, сгенерированного ИИ:
- Одна модель пишет код
- Другая модель проверяет его, не зная, кто его написал (слепая верификация)
- Межмодельный совет (Claude + GPT + Gemini) голосует, действительно ли код работает
- Агент-аналитик отслеживает закономерности в возникающих проблемах
Показатели эффективности
По результатам тестирования:
- Самопроверка одним агентом выявляет ~40% реальных проблем
- Межмодельная слепая проверка выявляет ~85%
- Накладные расходы: на 15-20% больше токенов
Возможности версии 0.2
- Панель аналитики для отслеживания использования токенов и затрат
- Агент-аналитик для автоматического выявления паттернов в проверке кода
- Агент-консультант для принятия архитектурных решений
- Улучшенная оркестрация на основе tmux
Установка и использование
Полностью открытый исходный код под лицензией MIT. Установка:
git clone https://github.com/project820/be-my-butler.git
cd be-my-butler && ./install.sh
bmb "build a REST API with auth"Инструмент особенно полезен для «виб-кодеров» — людей без традиционного опыта программирования, которые полагаются на ИИ для оценки качества кода. Когда вы не можете прочитать код и самостоятельно обнаружить проблемы, наличие нескольких моделей, проверяющих друг друга, обеспечивает верификацию, которой не хватает системам с одним агентом.
📖 Read the full source: r/ClaudeAI
👀 Смотрите также

Встроенный визуализатор: локальные модели ИИ теперь могут отображать интерактивные HTML-визуализации
Inline Visualizer — это плагин с лицензией BSD-3 для Open WebUI, который позволяет любой локальной AI-модели с поддержкой вызова инструментов отображать интерактивные HTML/SVG-визуализации прямо в чате, используя JavaScript-мост, позволяющий элементам отправлять сообщения обратно к AI.

Плагин Design Studio для Claude Code добавляет виртуальную дизайн-команду с 9 ролями и 16 командами.
Новый плагин Claude Code под названием Design Studio имитирует полноценную команду дизайнеров с 9 специализированными ролями, 16 слэш-командами и 5 агентами. Он автоматически определяет технологические стеки и включает более 8000 строк знаний о дизайне в справочных файлах.

Creation OS: Локальная σ-затворная среда выполнения LLM, позволяющая моделям говорить «Я не знаю» вместо галлюцинаций
Creation OS оборачивает локальные LLM (BitNet, Qwen, Gemma, любые GGUF) с σ-затвором, который измеряет несколько каналов неопределенности и принимает решение ACCEPT, RETHINK или ABSTAIN для каждого вывода. Без облака, без API. Точность TruthfulQA улучшена ~29% за счет селективной регенерации.

Агент ClawsifyAI обрабатывает задачи электронной почты, исследования и мозгового штурма
Разработчик тестировал ClawsifyAI, AI-агента в стиле когтевого бота, в течение недели и обнаружил, что он справляется с электронной почтой, исследованиями, рутинной работой и мозговыми штурмами. Агент предоставляет чёткую обратную связь, практические решения и иногда предлагает идеи лучше, чем изначально планировалось.