Реализация локального агента OpenClaw с кэшированием TurboQuant для оборудования среднего класса

Команда OpenClaw выпустила приложение в один клик, которое позволяет локальным агентным моделям работать на оборудовании среднего класса, таком как MacBook Air с 16 ГБ оперативной памяти и Mac Mini. Реализация решает проблему запуска сложных агентных моделей (таких как QWEN или GLM) на обычном оборудовании, используя сжатие кэша TurboQuant и процесс прогрева контекста.
Технические детали реализации
Решение основано на нескольких ключевых компонентах:
- Кэширование TurboQuant: Использует реализацию TurboQuant от Тома Тёрни для llama.cpp, которая была исправлена для корректной работы с вызовом инструментов в агентных моделях QWEN.
- Кэширование/прогрев контекста: Реализует специфичный для OpenClaw процесс "прогрева", который занимает несколько минут после запуска модели, но затем обеспечивает плавную обработку запросов на ограниченном оборудовании.
- Поддержка моделей: Протестировано с рассуждающей моделью Google Gemma 4 и QWEN 3.5, обе демонстрируют схожую производительность на стандартных машинах M4.
Тесты производительности
По результатам тестирования на MacBook Air с 16 ГБ памяти:
- Скорость обработки: И Gemma 4, и QWEN 3.5 обеспечивают примерно 10-15 токенов в секунду (tps)
- Сравнение скорости: QWEN показывает немного более высокую производительность, чем Gemma 4
- Производительность рассуждений: Сопоставима между двумя моделями, хотя ни одна не соответствует моделям Anthropic в сложных задачах или программировании
- Сравнение с облаком: Ответы в 2-3 раза медленнее, чем у мощных облачных моделей
Практическое применение
Данная реализация делает локальных агентов пригодными для:
- Повседневных задач, где скорость не критична
- Фоновых процессов на доступном оборудовании (например, Mac Mini за $600)
- Круглосуточного локального развертывания агентов, которое может окупиться за несколько месяцев
Команда отмечает, что хотя производительность рассуждений пока не соответствует топовым облачным моделям в сложных задачах, это представляет собой значительный шаг к практическому локальному развертыванию агентов на потребительском оборудовании.
📖 Read the full source: r/LocalLLaMA
👀 Смотрите также

Обновление AgentCrawl добавляет важные функции и улучшения для паука.
Последнее обновление AgentCrawl вводит такие функции, как соблюдение robots.txt, кэширование на диске, возможность возобновления обходов и извлечение структурированных метаданных, превращая его в более надежный инструмент, готовый к производственному использованию.

Бенчмарк MemAware показывает, что память агентов на основе RAG не справляется с неявным извлечением контекста.
Бенчмарк MemAware проверяет, могут ли ИИ-агенты извлекать релевантный прошлый контекст, когда пользователи явно об этом не спрашивают, показывая, что текущие системы памяти демонстрируют точность всего 2,8% на сложных неявных запросах против 0,8% без памяти.

BusyDog Desktop: Локальный ИИ-агент с P2P-сетью для Mac
BusyDog Desktop — это локальный ИИ-агент, который запускает Claude прямо на вашем Mac. Он может читать и записывать файлы, выполнять терминальные команды, управлять браузерами и подключаться к другим агентам через P2P-сеть с использованием Hyperswarm DHT и пользовательского протокола BDP.

JavaClaw Beta: Java-ориентированный ИИ-ассистент, созданный на основе Spring AI и JobRunr
Команда JobRunr выпустила бета-версию JavaClaw — Java-версию OpenClaw, которая работает локально с поддержкой многоканальности, выбором LLM и фоновой обработкой задач через JobRunr. Построена на Spring Boot 4, Spring AI и Spring Modulith.