Повторное использование кэша ключей-значений для длинных диалогов на Apple Silicon обеспечивает ускорение в 200 раз

✍️ OpenClawRadar📅 Опубликовано: 15 марта 2026 г.🔗 Source
Повторное использование кэша ключей-значений для длинных диалогов на Apple Silicon обеспечивает ускорение в 200 раз
Ad

Что это такое

Разработчик поделился экспериментальными результатами по реализации повторного использования кэша KV (ключ-значение) на основе сессий для локального вывода LLM на Apple Silicon с использованием фреймворка MLX. Целью было сделать длинные разговоры (100K+ токенов) практичными, устранив необходимость переобработки всего контекста на каждом шаге.

Ключевые результаты и бенчмарки

Основной подход заключался в сохранении кэша KV в памяти между поворотами разговора и обработке только новых токенов. Эта простая идея привела к впечатляющему улучшению производительности:

  • 200-кратное улучшение TTFT при контексте 100K: Без кэша: 126 секунд. С кэшем: 0.5 секунды. Это представляет собой 99.9% сокращение обработанных токенов.
  • Реальные показатели сессии: Тестирование с моделью Qwen3.5-397B на Mac Studio M3 Ultra 512GB во время 266-сообщенийной сессии агента OpenClaw показало:
    • Процент попаданий в кэш: 93.8%
    • TTFT для попаданий в кэш (<500 новых токенов): 1.0-1.3 секунды
    • TTFT для полного промаха кэша (124K токенов): 528 секунд (8.8 минут)
Ad

Что не сработало

Разработчик протестировал несколько попыток оптимизации, которые не увенчались успехом или ухудшили производительность:

  • Обрезка токенов мышления: Попытка удалить внутренние токены рассуждения модели из кэша для экономии места вызвала патологическое поведение. Ответы стали на 31% длиннее, а качество снизилось, поскольку модель ссылается на свои прошлые рассуждения между шагами.
  • Вращающийся кэш KV (8192 токена): Хотя это обеспечило наилучшую скорость токенов в секунду (TPS), это привело к потере моделью более раннего контекста, при этом показатель запоминания значительно упал (до 4 из 8 элементов).
  • 8-битная квантизация KV: Это привело к падению TPS на 16.5%, так как вычислительные накладные расходы превысили экономию пропускной способности памяти.

Реализация и оборудование

Реализация является частью открытого личного проекта под названием SoloHeaven, доступного по лицензии MIT на GitHub: https://github.com/joongom/mlx-soloheaven. README содержит полные таблицы бенчмарков.

Тестирование проводилось на Mac Studio M3 Ultra с 512 ГБ ОЗУ и 4 ТБ хранилища с использованием следующих моделей, конвертированных для MLX:

  • Qwen3.5-122B-A10B-bf16
  • Qwen3.5-397B-A17B-MLX-8bit

📖 Read the full source: r/LocalLLaMA

Ad

👀 Смотрите также

Развертывание OpenClaw на AWS: акцент на автоматизацию
Инструменты

Развертывание OpenClaw на AWS: акцент на автоматизацию

Инструмент OpenClaw предлагает возможность развертывания на AWS в один клик, упрощая облачные операции для разработчиков, использующих ИИ-агентов для кодирования.

OpenClawRadar
agent-data: Структурированные веб-данные для агентов OpenClaw, на 70% дешевле автоматизации браузера
Инструменты

agent-data: Структурированные веб-данные для агентов OpenClaw, на 70% дешевле автоматизации браузера

agent-data предоставляет конечные точки API на чистом Python для X, Reddit, авиарейсов и списков вакансий, разработанные для AI-агентов, таких как OpenClaw — без необходимости в автоматизации браузера. Тестирование показывает значительную экономию средств и повышение надежности.

OpenClawRadar
Claude Academy: Бесплатный учебный курс по программированию, работающий внутри Claude Desktop
Инструменты

Claude Academy: Бесплатный учебный курс по программированию, работающий внутри Claude Desktop

Разработчик создал Claude Academy — бесплатный учебный курс по программированию, который полностью работает во вкладке Code в Claude Desktop. Система использует три команды для проведения 64 структурированных уроков по основам веб-разработки, с отслеживанием прогресса и созданием реальных проектов.

OpenClawRadar
Клод Код против OpenCode: Ключевые технические различия, обнаруженные разработчиком
Инструменты

Клод Код против OpenCode: Ключевые технические различия, обнаруженные разработчиком

Разработчик сравнивает Claude Code и OpenCode по контексту, памяти, использованию инструментов, подагентам, разрешениям, безопасности и гибкости моделей, заключая, что Claude Code по-прежнему выигрывает для работы с продуктивными репозиториями.

OpenClawRadar