Эволюция архитектуры KV-кэша: от GPT-2 до Mamba

Затраты памяти на KV-кэш в различных архитектурах моделей
Недавний анализ эволюции архитектуры KV-кэша выявил значительные улучшения в эффективности использования памяти в трансформерных моделях. Эта прогрессия показывает, как различные механизмы внимания сократили объём памяти GPU, необходимый для поддержания контекста разговора во время инференса.
Сравнение конкретных архитектур
- GPT-2 (2019): 300 КБайт/токен. Использует многоголовое внимание, где каждая голова поддерживает собственные ключи и значения без совместного использования. Разговор на 4000 токенов требует примерно 1,2 ГБ памяти GPU только для кэша, отдельно от весов модели.
- Llama 3 (2024): 128 КБайт/токен. Реализует групповое запросное внимание, где несколько голов запросов используют одни и те же пары ключ-значение. Это менее половины затрат GPT-2, основано на инсайте, что многие головы изучали избыточные представления.
- DeepSeek V3 (2024): 68,6 КБайт/токен. Использует многоголовое латентное внимание, которое сжимает пары ключ-значение в пространство меньшей размерности и распаковывает их при инференсе. Это модель с 671B параметров, из которых 37B активны через MoE. Абляционные исследования DeepSeek V2, на которых строится архитектура V3, показали, что сжатое представление соответствует или немного превосходит стандартное MHA в нескольких бенчмарках.
- Gemma 3 (2025): Использует GQA плюс скользящее окно с соотношением локальных к глобальным слоям внимания 5:1, где локальные слои обращают внимание только на 1024 токена. Показывает почти нулевую потерю перплексии от агрессивной фильтрации.
- Mamba/SSM (2023): KV-кэш отсутствует полностью. Использует скрытое состояние фиксированного размера, обновляемое для каждого токена. Модель решает, что сжимать в реальном времени, вместо того чтобы хранить всё и обрабатывать позже.
Архитектурные пробелы и практические последствия
Анализ подчёркивает разрыв между рабочей памятью и постоянными знаниями в современных архитектурах. KV-кэш сохраняется от секунд до минут (заявленное время жизни кэша составляет 5-10 минут, варьируется в зависимости от провайдера и нагрузки), а затем исчезает. Между временным кэшем и постоянными весами нет встроенной среднесрочной памяти или архитектурного слота для информации вроде "я разговаривал с этим пользователем в прошлый вторник".
Текущие решения, такие как RAG, файловые системы, векторные БД и системные промпты, несущие курируемый контекст, описываются как "мостики через архитектурную пустоту" — системы поиска, прикрученные к моделям без внутреннего среднесрочного хранилища.
Проблема компактификации иллюстрирует это ограничение. Когда контекст становится слишком большим, модели суммируют свою собственную историю, очищают кэш и продолжают с этого резюме. Это может привести к потере точности (политика публикации с шестью правилами превращается в "что-то о редакционных руководствах") и к тому, что модели уверенно работают с ухудшенным контекстом, не зная, что было утрачено.
Подход Cursor с обученной компактификацией обучает модели хорошо само-суммироваться через RL, а не просто промптить сжатие, но доказательства ограничены одним кодировочным бенчмарком. Код предоставляет чистые сигналы вознаграждения (тесты проходят или проваливаются), в отличие от сценариев вроде компактификации редакционных заметок, стратегического планирования или разговоров, где критические детали не понадобятся в течение многих сообщений.
📖 Read the full source: r/LocalLLaMA
👀 Смотрите также

本地LLM基准测试:通过函数调用生成后端——GLM、Qwen、DeepSeek对比
Строгий бенчмарк локальных и frontier LLM для генерации бэкенд-кода через вызов функций с оценочной рубрикой. Ключевые выводы: qwen3.5-35b-a3b соответствует gpt-5.4 в проектировании БД/API, а плотная Qwen 27B превосходит 397B MoE. Frontier модели исключены из-за стоимости.

Состояние открытого ИИ: паритет достигнут, производственный разрыв сохраняется
Отчет Mozilla за 2026 год показал, что модели с открытым весом сравнялись с закрытыми по кодированию и общим знаниям, стоимость вывода упала в 50 раз до $0,40 за 1 млн токенов. Но лишь 51% команд с открытыми моделями достигают продакшена против 63% у закрытых.

Anthropic запускает Claude Code Channels для обмена сообщениями через Telegram или Discord
Anthropic выпустила Claude Code Channels, позволяя разработчикам общаться со своими сессиями ИИ-кодирования из Telegram или Discord, сохраняя код локально.

Пандемия «Я не знаю, это написал Клод»: когда когнитивная капитуляция заменяет владение кодом
Инженеры делегируют архитектурные решения Клоду, а потом не могут объяснить свой PR. Адди Османи называет это «когнитивной капитуляцией» — вывод ИИ становится вашим без проверки.