llama.cpp Массовая повторная обработка запросов с помощью кодовых агентов: отладка KV-кэша и обмена контекстом

Разработчик на r/LocalLLaMA столкнулся с серьезной проблемой производительности llama.cpp при запуске длинноконтекстных кодирующих агентов (opencode + pi.dev) через llama-swap. Даже при очень похожих промптах (сходство LCP часто >0.99) система периодически сбрасывает кэш KV и перерабатывает 40k+ токенов, что приводит к TTFT в несколько минут.
Наблюдаемое поведение
- Контекст вырастает до 50k+ токенов.
- После нескольких обычных повторных использований (например,
prompt eval time = 473 ms / 19 tokens) значениеn_pastвнезапно падает до ~4-5k. - llama.cpp затем перерабатывает полный промпт:
n_tokens = 4750 prompt eval time = 222411 ms / 44016 tokens. - Использование кэша достигает 4676 МиБ, превышая установленный лимит (2500 МиБ).
Текущая конфигурация
llama-server --ctx-size 150000 --parallel 1 --ctx-checkpoints 32 --cache-ram 2500 --cache-reuse 256 -no-kvu --no-context-shiftПредполагаемые причины
- Инвалидация кэша из-за переполнения лимита
--cache-ram– лог показывает 4676 МиБ использования против лимита 2500 МиБ. - Плохой механизм повторного использования KV при изменении начальных токенов промпта (возможно, частые изменения в opencode).
- Недостаточные значения
--ctx-checkpointsили--cache-reuseдля размера контекста 150k.
Рекомендации сообщества
В обсуждении пока мало ответов, но очевидные первые шаги: увеличить --cache-ram до уровня типичного использования (например, 5000+ МиБ) или уменьшить --ctx-size, чтобы оставаться в пределах лимита кэша. Также стоит проверить, не изменяет ли opencode намеренно префиксы промптов; если да, фиксация системного промпта или использование фиксированного префикса может улучшить повторное использование.
Разработчикам, использующим подобные конфигурации, предлагается делиться своими рабочими настройками в исходном обсуждении.
📖 Читать полный источник: r/LocalLLaMA
👀 Смотрите также

Как перестать сталкиваться с лимитами Клода: относитесь к каждой сессии как к бюджету токенов
Пользователь делится, как решил проблему дневных лимитов Claude, остановив разрастание сообщений: ограничьте задачу, загружайте только актуальный контекст, очищайте после каждого сеанса. Включает практический рабочий процесс и инфографику.

Claude Code и неразумная эффективность HTML для AI-агентов
Вирусный пост демонстрирует, что AI-агенты кодирования, такие как Claude Code, дают лучшие результаты, когда их просят генерировать HTML, с рабочими примерами и сопутствующей статьей, обсуждающей этот подход.

Исследование использования токена OpenClaw выявило проблемы с конфигурацией.
Разработчик потратил свою еженедельную подписку на OpenAI Codex за 1,5 дня и использовал Claude Code для выявления проблем с конфигурацией: Telegram-боты срабатывали на каждое сообщение, веб-запросы возвращали сырой CSS/JS, а также накапливались неиспользуемые файлы сессий.

8 месяцев ежедневного использования Claude: 9 практических советов (не для программирования)
Пользователь Reddit делится 9 выстраданными уроками за 8 месяцев ежедневного использования Claude для написания текстов и исследований (не кода): редактирование, управление контекстом, настройка стиля и использование Claude в качестве партнёра для размышлений.