Результаты тестирования: система агентов Claude с памятью демонстрирует экономию токенов на 30-43%

Тестирование системы памяти для роёв агентов Claude
Разработчик девять месяцев создавал систему памяти под названием Stompy, эволюционировавшую от файловой базы к SQLite и затем к PostgreSQL. Целью было минимизировать использование токенов при работе роёв агентов Claude. Они провели сравнительный тест производительности с системой памяти и без неё.
Настройка теста
В тесте использовалась задача по кодированию из 40 пунктов, требующая реализации полной функции бронирования с бэкендом, фронтендом и тестами. Рой из 6 агентов тестировался с тремя разными моделями Claude в качестве ведущего: Sonnet 4.6, Opus 4.6 и Haiku 4.5. Все тесты использовали одну и ту же кодовую базу, одних и тех же агентов-компаньонов и одинаковую систему оценки. Агенты-компаньоны всегда работали на Opus независимо от ведущей модели.
Результаты тестирования
- Sonnet 4.6 + память: 40/40, $3.98, 6.5 мин, 2 подхода
- Sonnet 4.6 без памяти: 40/40, $7.04, 9.6 мин, 4 подхода
- Opus 4.6 + память: 40/40, $4.34, 9.6 мин, 29 подходов
- Opus 4.6 без памяти: 40/40, $7.65, 10.0 мин, 70 подходов
- Haiku 4.5 + память: 39/40, $4.95, 7.5 мин, 2 подхода
- Haiku 4.5 без памяти: 0/40, $3.97, 5.8 мин, 3 подхода
Ключевые выводы
Opus и Sonnet с памятью позволили сэкономить около 43% стоимости по сравнению с работой без памяти. Разработчик отмечает, что эти модели достаточно умны, чтобы выполнить задачу без памяти, но они тратят токены на изучение кодовой базы, чего система памяти позволяет избежать.
Результат Haiku оказался неожиданным: он набрал 0/40 без памяти, но 39/40 с памятью. Разработчик заметил, что Haiku не мог координировать агентов-компаньонов Opus без понимания структуры проекта, но стал компетентным ведущим при доступе к памяти.
Sonnet с памятью оказался лучшей общей конфигурацией, превзойдя Opus без памяти по всем показателям примерно при вдвое меньшей стоимости. Главный вывод заключается в том, что предоставление модели знаний о проекте важнее, чем использование дорогих моделей.
Технические детали
Система памяти называется Stompy и основана на MCP/API/CLI, работая с Claude Code. Настройка теста доступна на GitHub для использования или улучшения другими. Разработчик отмечает, что пока это n=1 на условие, планируется больше запусков.
📖 Read the full source: r/ClaudeAI
👀 Смотрите также

Настройка OpenClaw в UTM-виртуальной машине Ubuntu с доступом к LLM API и Ollama
Пользователь успешно настроил OpenClaw в изолированной виртуальной машине Ubuntu на Mac с процессором M3, получив доступ как к локальному Ollama на macOS, так и к внешним API LLM, таким как Gemini, Claude и DeepSeek. Примеры файлов конфигурации и заметки по устранению неполадок доступны на GitHub.

PocketTeam: Конвейер кода Claude с безопасностью на основе хуков и обучающимися агентами
PocketTeam — это конвейер Claude Code, который реализует 9 уровней безопасности на уровне вызова инструментов для блокировки опасных операций, таких как запись в .env или команды rm -rf. Система включает агента-наблюдателя, который анализирует выполненные задачи и записывает структурированные выводы для повышения производительности будущих агентов.

Бенчмарк: MLX vs Ollama, запуск Qwen3-Coder-Next 8-Bit на MacBook Pro M5 Max
Бенчмарк, сравнивающий бэкенды MLX и Ollama, работающие с квантованной 8-битной версией Qwen3-Coder-Next на MacBook Pro M5 Max с 128 ГБ оперативной памяти, показал, что MLX достигает примерно 72 токенов в секунду, что примерно вдвое превышает пропускную способность Ollama в различных задачах программирования.

Agent MCP Studio: Создавайте мультиагентные MCP-системы полностью в браузере через WASM
Agent MCP Studio позволяет проектировать, оркестрировать и экспортировать MCP-агентные системы из одного статического HTML-файла с использованием WebAssembly – без бэкенда, Docker и сервера.