Повторное использование кэша ключей-значений для длинных диалогов на Apple Silicon обеспечивает ускорение в 200 раз

✍️ OpenClawRadar📅 Опубликовано: 15 марта 2026 г.🔗 Source
Повторное использование кэша ключей-значений для длинных диалогов на Apple Silicon обеспечивает ускорение в 200 раз
Ad

Что это такое

Разработчик поделился экспериментальными результатами по реализации повторного использования кэша KV (ключ-значение) на основе сессий для локального вывода LLM на Apple Silicon с использованием фреймворка MLX. Целью было сделать длинные разговоры (100K+ токенов) практичными, устранив необходимость переобработки всего контекста на каждом шаге.

Ключевые результаты и бенчмарки

Основной подход заключался в сохранении кэша KV в памяти между поворотами разговора и обработке только новых токенов. Эта простая идея привела к впечатляющему улучшению производительности:

  • 200-кратное улучшение TTFT при контексте 100K: Без кэша: 126 секунд. С кэшем: 0.5 секунды. Это представляет собой 99.9% сокращение обработанных токенов.
  • Реальные показатели сессии: Тестирование с моделью Qwen3.5-397B на Mac Studio M3 Ultra 512GB во время 266-сообщенийной сессии агента OpenClaw показало:
    • Процент попаданий в кэш: 93.8%
    • TTFT для попаданий в кэш (<500 новых токенов): 1.0-1.3 секунды
    • TTFT для полного промаха кэша (124K токенов): 528 секунд (8.8 минут)
Ad

Что не сработало

Разработчик протестировал несколько попыток оптимизации, которые не увенчались успехом или ухудшили производительность:

  • Обрезка токенов мышления: Попытка удалить внутренние токены рассуждения модели из кэша для экономии места вызвала патологическое поведение. Ответы стали на 31% длиннее, а качество снизилось, поскольку модель ссылается на свои прошлые рассуждения между шагами.
  • Вращающийся кэш KV (8192 токена): Хотя это обеспечило наилучшую скорость токенов в секунду (TPS), это привело к потере моделью более раннего контекста, при этом показатель запоминания значительно упал (до 4 из 8 элементов).
  • 8-битная квантизация KV: Это привело к падению TPS на 16.5%, так как вычислительные накладные расходы превысили экономию пропускной способности памяти.

Реализация и оборудование

Реализация является частью открытого личного проекта под названием SoloHeaven, доступного по лицензии MIT на GitHub: https://github.com/joongom/mlx-soloheaven. README содержит полные таблицы бенчмарков.

Тестирование проводилось на Mac Studio M3 Ultra с 512 ГБ ОЗУ и 4 ТБ хранилища с использованием следующих моделей, конвертированных для MLX:

  • Qwen3.5-122B-A10B-bf16
  • Qwen3.5-397B-A17B-MLX-8bit

📖 Read the full source: r/LocalLLaMA

Ad

👀 Смотрите также

Разработчик OpenClaw достигает прорывов в области ИИ-агентов с автоматизацией бронирования Uber и ресторанов.
Инструменты

Разработчик OpenClaw достигает прорывов в области ИИ-агентов с автоматизацией бронирования Uber и ресторанов.

Разработчик OpenClaw успешно создал ИИ-агентов, которые автономно выполняют бронирование поездок в Uber и ресторанов на реальных веб-сайтах, обходя системы обнаружения ботов и CAPTCHA с использованием стека технологий, включающего скрытые браузеры, резидентские прокси и решения для CAPTCHA.

OpenClawRadar
Терминальный 3D-рендерер, созданный с помощью мультиагентной системы кодирования Claude
Инструменты

Терминальный 3D-рендерер, созданный с помощью мультиагентной системы кодирования Claude

Разработчик создал tortuise — чисто терминальный 3D-рендерер, отображающий гауссовы сплаты с помощью символов Unicode и ASCII, построенный за 3 дня с использованием 70-80 ИИ-агентов, скоординированных через настройку Claude Code с подагентами внутри подагентов.

OpenClawRadar
Тесты локальных LLM на RTX 5060 Ti 16 ГБ: Модели на 30 млрд параметров по-прежнему лидируют в программировании.
Инструменты

Тесты локальных LLM на RTX 5060 Ti 16 ГБ: Модели на 30 млрд параметров по-прежнему лидируют в программировании.

Тесты на RTX 5060 Ti 16GB показывают, что модель Unsloth Qwen3-Coder-30B UD-Q3_K_XL достигает 76.3 ток/с на Ubuntu с оценкой качества 8.14, что делает её рекомендуемой моделью по умолчанию для кодирования. Модель Unsloth Qwen3.5-35B UD-Q2_K_XL достигает 80.1 ток/с, но с более низкими оценками качества.

OpenClawRadar
Запуск NemoClaw с локальным vLLM: Заметки по настройке и наблюдения по разработке агентов
Инструменты

Запуск NemoClaw с локальным vLLM: Заметки по настройке и наблюдения по разработке агентов

Разработчик задокументировал запуск платформы изолированных AI-агентов NVIDIA NemoClaw с локальной моделью Nemotron 9B v2 через vLLM на WSL2. Ключевые выводы включают детали маршрутизации вывода, проблемы совместимости парсеров и наблюдения о разрыве в разработке агентов.

OpenClawRadar