llama.cpp Reprocessamento Massivo de Prompts com Agentes de Codificação: Depuração do Cache KV e Troca de Contexto

Um desenvolvedor no r/LocalLLaMA está enfrentando um sério problema de performance com o llama.cpp ao executar agentes de codificação de contexto longo (opencode + pi.dev) via llama-swap. Mesmo com prompts altamente semelhantes (similaridade LCP frequentemente >0,99), o sistema descarta periodicamente o cache KV e reprocessa 40k+ tokens, causando TTFT de vários minutos.
Comportamento Observado
- O contexto cresce para 50k+ tokens.
- Após várias reutilizações normais (ex.:
prompt eval time = 473 ms / 19 tokens), on_pastcai subitamente para ~4-5k. - O llama.cpp então reprocessa o prompt completo:
n_tokens = 4750 prompt eval time = 222411 ms / 44016 tokens. - O uso do cache atinge 4676 MiB, excedendo o limite configurado (2500 MiB).
Configuração Atual
llama-server --ctx-size 150000 --parallel 1 --ctx-checkpoints 32 --cache-ram 2500 --cache-reuse 256 -no-kvu --no-context-shiftCausas Suspeitas
- Invalidação do cache devido ao estouro do limite de
--cache-ram– o log mostra 4676 MiB usados vs. limite de 2500 MiB. - Mecanismo de reutilização KV ruim quando os tokens iniciais do prompt mudam (possivelmente alterações frequentes pelo opencode).
--ctx-checkpointsou--cache-reuseinsuficientes para o tamanho de contexto de 150k.
Recomendações da Comunidade
A discussão ainda tem poucas respostas, mas os primeiros passos óbvios incluem aumentar --cache-ram para corresponder ao uso típico (ex.: 5000+ MiB), ou reduzir --ctx-size para ficar abaixo do limite do cache. Verifique também se o opencode está alterando intencionalmente os prefixos do prompt; em caso afirmativo, travar o prompt do sistema ou usar um prefixo fixo pode melhorar a reutilização.
Para desenvolvedores com configurações semelhantes, compartilhem suas configurações funcionando no tópico de origem.
📖 Leia a fonte completa: r/LocalLLaMA
👀 See Also

Use HTML como Linguagem Principal de Chat para Agentes de Codificação de IA para Habilitar Diagramas SVG
Um desenvolvedor trocou os prompts de sistema do agente de codificação de Markdown para HTML, permitindo que os agentes renderizassem diagramas SVG e tabelas ricas diretamente no chat. Usando Qwen3.6-27B com uma interface HTML-first.

OpenClaw Implementa Correção de Custo da API e Melhorias na Ferramenta de Modelo Local
A OpenClaw lançou atualizações importantes que abordam os custos de uso da API e melhoram as integrações de ferramentas de modelos locais, aprimorando a experiência do desenvolvedor e a eficiência operacional.

Não Presuma que Modelos Caros São Melhores: Estudo de Caso Mostra Economia de 13x nos Custos ao Testar
Usuário substituiu GPT-5.4 por Gemini 3.1 Flash Lite em uma tarefa de classificação, alcançando exatamente 85% de precisão com 1/13 do custo após executar avaliações em 21 modelos.
Um timeout do cron não prova que sua ação no OpenClaw falhou
Se um job cron expirar após enviar uma mensagem ou publicar conteúdo, o OpenClaw sabe que a execução falhou, mas não sabe se o provedor aceitou a ação. Trate timeouts ambíguos como desconhecidos, não como falhos.