Повторное использование кэша ключей-значений для длинных диалогов на Apple Silicon обеспечивает ускорение в 200 раз

Что это такое
Разработчик поделился экспериментальными результатами по реализации повторного использования кэша KV (ключ-значение) на основе сессий для локального вывода LLM на Apple Silicon с использованием фреймворка MLX. Целью было сделать длинные разговоры (100K+ токенов) практичными, устранив необходимость переобработки всего контекста на каждом шаге.
Ключевые результаты и бенчмарки
Основной подход заключался в сохранении кэша KV в памяти между поворотами разговора и обработке только новых токенов. Эта простая идея привела к впечатляющему улучшению производительности:
- 200-кратное улучшение TTFT при контексте 100K: Без кэша: 126 секунд. С кэшем: 0.5 секунды. Это представляет собой 99.9% сокращение обработанных токенов.
- Реальные показатели сессии: Тестирование с моделью Qwen3.5-397B на Mac Studio M3 Ultra 512GB во время 266-сообщенийной сессии агента OpenClaw показало:
- Процент попаданий в кэш: 93.8%
- TTFT для попаданий в кэш (<500 новых токенов): 1.0-1.3 секунды
- TTFT для полного промаха кэша (124K токенов): 528 секунд (8.8 минут)
Что не сработало
Разработчик протестировал несколько попыток оптимизации, которые не увенчались успехом или ухудшили производительность:
- Обрезка токенов мышления: Попытка удалить внутренние токены рассуждения модели из кэша для экономии места вызвала патологическое поведение. Ответы стали на 31% длиннее, а качество снизилось, поскольку модель ссылается на свои прошлые рассуждения между шагами.
- Вращающийся кэш KV (8192 токена): Хотя это обеспечило наилучшую скорость токенов в секунду (TPS), это привело к потере моделью более раннего контекста, при этом показатель запоминания значительно упал (до 4 из 8 элементов).
- 8-битная квантизация KV: Это привело к падению TPS на 16.5%, так как вычислительные накладные расходы превысили экономию пропускной способности памяти.
Реализация и оборудование
Реализация является частью открытого личного проекта под названием SoloHeaven, доступного по лицензии MIT на GitHub: https://github.com/joongom/mlx-soloheaven. README содержит полные таблицы бенчмарков.
Тестирование проводилось на Mac Studio M3 Ultra с 512 ГБ ОЗУ и 4 ТБ хранилища с использованием следующих моделей, конвертированных для MLX:
- Qwen3.5-122B-A10B-bf16
- Qwen3.5-397B-A17B-MLX-8bit
📖 Read the full source: r/LocalLLaMA
👀 Смотрите также

Развертывание OpenClaw на AWS: акцент на автоматизацию
Инструмент OpenClaw предлагает возможность развертывания на AWS в один клик, упрощая облачные операции для разработчиков, использующих ИИ-агентов для кодирования.

agent-data: Структурированные веб-данные для агентов OpenClaw, на 70% дешевле автоматизации браузера
agent-data предоставляет конечные точки API на чистом Python для X, Reddit, авиарейсов и списков вакансий, разработанные для AI-агентов, таких как OpenClaw — без необходимости в автоматизации браузера. Тестирование показывает значительную экономию средств и повышение надежности.

Claude Academy: Бесплатный учебный курс по программированию, работающий внутри Claude Desktop
Разработчик создал Claude Academy — бесплатный учебный курс по программированию, который полностью работает во вкладке Code в Claude Desktop. Система использует три команды для проведения 64 структурированных уроков по основам веб-разработки, с отслеживанием прогресса и созданием реальных проектов.

Клод Код против OpenCode: Ключевые технические различия, обнаруженные разработчиком
Разработчик сравнивает Claude Code и OpenCode по контексту, памяти, использованию инструментов, подагентам, разрешениям, безопасности и гибкости моделей, заключая, что Claude Code по-прежнему выигрывает для работы с продуктивными репозиториями.