Эволюция архитектуры KV-кэша: от GPT-2 до Mamba

✍️ OpenClawRadar📅 Опубликовано: 29 марта 2026 г.🔗 Source
Эволюция архитектуры KV-кэша: от GPT-2 до Mamba
Ad

Затраты памяти на KV-кэш в различных архитектурах моделей

Недавний анализ эволюции архитектуры KV-кэша выявил значительные улучшения в эффективности использования памяти в трансформерных моделях. Эта прогрессия показывает, как различные механизмы внимания сократили объём памяти GPU, необходимый для поддержания контекста разговора во время инференса.

Сравнение конкретных архитектур

  • GPT-2 (2019): 300 КБайт/токен. Использует многоголовое внимание, где каждая голова поддерживает собственные ключи и значения без совместного использования. Разговор на 4000 токенов требует примерно 1,2 ГБ памяти GPU только для кэша, отдельно от весов модели.
  • Llama 3 (2024): 128 КБайт/токен. Реализует групповое запросное внимание, где несколько голов запросов используют одни и те же пары ключ-значение. Это менее половины затрат GPT-2, основано на инсайте, что многие головы изучали избыточные представления.
  • DeepSeek V3 (2024): 68,6 КБайт/токен. Использует многоголовое латентное внимание, которое сжимает пары ключ-значение в пространство меньшей размерности и распаковывает их при инференсе. Это модель с 671B параметров, из которых 37B активны через MoE. Абляционные исследования DeepSeek V2, на которых строится архитектура V3, показали, что сжатое представление соответствует или немного превосходит стандартное MHA в нескольких бенчмарках.
  • Gemma 3 (2025): Использует GQA плюс скользящее окно с соотношением локальных к глобальным слоям внимания 5:1, где локальные слои обращают внимание только на 1024 токена. Показывает почти нулевую потерю перплексии от агрессивной фильтрации.
  • Mamba/SSM (2023): KV-кэш отсутствует полностью. Использует скрытое состояние фиксированного размера, обновляемое для каждого токена. Модель решает, что сжимать в реальном времени, вместо того чтобы хранить всё и обрабатывать позже.
Ad

Архитектурные пробелы и практические последствия

Анализ подчёркивает разрыв между рабочей памятью и постоянными знаниями в современных архитектурах. KV-кэш сохраняется от секунд до минут (заявленное время жизни кэша составляет 5-10 минут, варьируется в зависимости от провайдера и нагрузки), а затем исчезает. Между временным кэшем и постоянными весами нет встроенной среднесрочной памяти или архитектурного слота для информации вроде "я разговаривал с этим пользователем в прошлый вторник".

Текущие решения, такие как RAG, файловые системы, векторные БД и системные промпты, несущие курируемый контекст, описываются как "мостики через архитектурную пустоту" — системы поиска, прикрученные к моделям без внутреннего среднесрочного хранилища.

Проблема компактификации иллюстрирует это ограничение. Когда контекст становится слишком большим, модели суммируют свою собственную историю, очищают кэш и продолжают с этого резюме. Это может привести к потере точности (политика публикации с шестью правилами превращается в "что-то о редакционных руководствах") и к тому, что модели уверенно работают с ухудшенным контекстом, не зная, что было утрачено.

Подход Cursor с обученной компактификацией обучает модели хорошо само-суммироваться через RL, а не просто промптить сжатие, но доказательства ограничены одним кодировочным бенчмарком. Код предоставляет чистые сигналы вознаграждения (тесты проходят или проваливаются), в отличие от сценариев вроде компактификации редакционных заметок, стратегического планирования или разговоров, где критические детали не понадобятся в течение многих сообщений.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Смотрите также

本地LLM基准测试:通过函数调用生成后端——GLM、Qwen、DeepSeek对比
Новости

本地LLM基准测试:通过函数调用生成后端——GLM、Qwen、DeepSeek对比

Строгий бенчмарк локальных и frontier LLM для генерации бэкенд-кода через вызов функций с оценочной рубрикой. Ключевые выводы: qwen3.5-35b-a3b соответствует gpt-5.4 в проектировании БД/API, а плотная Qwen 27B превосходит 397B MoE. Frontier модели исключены из-за стоимости.

OpenClawRadar
Состояние открытого ИИ: паритет достигнут, производственный разрыв сохраняется
Новости

Состояние открытого ИИ: паритет достигнут, производственный разрыв сохраняется

Отчет Mozilla за 2026 год показал, что модели с открытым весом сравнялись с закрытыми по кодированию и общим знаниям, стоимость вывода упала в 50 раз до $0,40 за 1 млн токенов. Но лишь 51% команд с открытыми моделями достигают продакшена против 63% у закрытых.

OpenClawRadar
Anthropic запускает Claude Code Channels для обмена сообщениями через Telegram или Discord
Новости

Anthropic запускает Claude Code Channels для обмена сообщениями через Telegram или Discord

Anthropic выпустила Claude Code Channels, позволяя разработчикам общаться со своими сессиями ИИ-кодирования из Telegram или Discord, сохраняя код локально.

OpenClawRadar
Пандемия «Я не знаю, это написал Клод»: когда когнитивная капитуляция заменяет владение кодом
Новости

Пандемия «Я не знаю, это написал Клод»: когда когнитивная капитуляция заменяет владение кодом

Инженеры делегируют архитектурные решения Клоду, а потом не могут объяснить свой PR. Адди Османи называет это «когнитивной капитуляцией» — вывод ИИ становится вашим без проверки.

OpenClawRadar