Повторное использование кэша ключей-значений для длинных диалогов на Apple Silicon обеспечивает ускорение в 200 раз

Что это такое
Разработчик поделился экспериментальными результатами по реализации повторного использования кэша KV (ключ-значение) на основе сессий для локального вывода LLM на Apple Silicon с использованием фреймворка MLX. Целью было сделать длинные разговоры (100K+ токенов) практичными, устранив необходимость переобработки всего контекста на каждом шаге.
Ключевые результаты и бенчмарки
Основной подход заключался в сохранении кэша KV в памяти между поворотами разговора и обработке только новых токенов. Эта простая идея привела к впечатляющему улучшению производительности:
- 200-кратное улучшение TTFT при контексте 100K: Без кэша: 126 секунд. С кэшем: 0.5 секунды. Это представляет собой 99.9% сокращение обработанных токенов.
- Реальные показатели сессии: Тестирование с моделью Qwen3.5-397B на Mac Studio M3 Ultra 512GB во время 266-сообщенийной сессии агента OpenClaw показало:
- Процент попаданий в кэш: 93.8%
- TTFT для попаданий в кэш (<500 новых токенов): 1.0-1.3 секунды
- TTFT для полного промаха кэша (124K токенов): 528 секунд (8.8 минут)
Что не сработало
Разработчик протестировал несколько попыток оптимизации, которые не увенчались успехом или ухудшили производительность:
- Обрезка токенов мышления: Попытка удалить внутренние токены рассуждения модели из кэша для экономии места вызвала патологическое поведение. Ответы стали на 31% длиннее, а качество снизилось, поскольку модель ссылается на свои прошлые рассуждения между шагами.
- Вращающийся кэш KV (8192 токена): Хотя это обеспечило наилучшую скорость токенов в секунду (TPS), это привело к потере моделью более раннего контекста, при этом показатель запоминания значительно упал (до 4 из 8 элементов).
- 8-битная квантизация KV: Это привело к падению TPS на 16.5%, так как вычислительные накладные расходы превысили экономию пропускной способности памяти.
Реализация и оборудование
Реализация является частью открытого личного проекта под названием SoloHeaven, доступного по лицензии MIT на GitHub: https://github.com/joongom/mlx-soloheaven. README содержит полные таблицы бенчмарков.
Тестирование проводилось на Mac Studio M3 Ultra с 512 ГБ ОЗУ и 4 ТБ хранилища с использованием следующих моделей, конвертированных для MLX:
- Qwen3.5-122B-A10B-bf16
- Qwen3.5-397B-A17B-MLX-8bit
📖 Read the full source: r/LocalLLaMA
👀 Смотрите также

Разработчик OpenClaw достигает прорывов в области ИИ-агентов с автоматизацией бронирования Uber и ресторанов.
Разработчик OpenClaw успешно создал ИИ-агентов, которые автономно выполняют бронирование поездок в Uber и ресторанов на реальных веб-сайтах, обходя системы обнаружения ботов и CAPTCHA с использованием стека технологий, включающего скрытые браузеры, резидентские прокси и решения для CAPTCHA.

Терминальный 3D-рендерер, созданный с помощью мультиагентной системы кодирования Claude
Разработчик создал tortuise — чисто терминальный 3D-рендерер, отображающий гауссовы сплаты с помощью символов Unicode и ASCII, построенный за 3 дня с использованием 70-80 ИИ-агентов, скоординированных через настройку Claude Code с подагентами внутри подагентов.

Тесты локальных LLM на RTX 5060 Ti 16 ГБ: Модели на 30 млрд параметров по-прежнему лидируют в программировании.
Тесты на RTX 5060 Ti 16GB показывают, что модель Unsloth Qwen3-Coder-30B UD-Q3_K_XL достигает 76.3 ток/с на Ubuntu с оценкой качества 8.14, что делает её рекомендуемой моделью по умолчанию для кодирования. Модель Unsloth Qwen3.5-35B UD-Q2_K_XL достигает 80.1 ток/с, но с более низкими оценками качества.

Запуск NemoClaw с локальным vLLM: Заметки по настройке и наблюдения по разработке агентов
Разработчик задокументировал запуск платформы изолированных AI-агентов NVIDIA NemoClaw с локальной моделью Nemotron 9B v2 через vLLM на WSL2. Ключевые выводы включают детали маршрутизации вывода, проблемы совместимости парсеров и наблюдения о разрыве в разработке агентов.