llama.cpp Reprocesamiento Masivo de Prompts con Agentes de Codificación: Depuración de Caché KV e Intercambio de Contexto

Un desarrollador en r/LocalLLaMA se encuentra con un grave problema de rendimiento con llama.cpp al ejecutar agentes de codificación de contexto largo (opencode + pi.dev) a través de llama-swap. Incluso con prompts muy similares (similitud LCP a menudo >0,99), el sistema descarta periódicamente la caché KV y reprocesa más de 40k tokens, lo que provoca un TTFT de varios minutos.
Comportamiento observado
- El contexto crece hasta 50k+ tokens.
- Después de varios reúsos normales (por ejemplo,
prompt eval time = 473 ms / 19 tokens),n_pastcae repentinamente a ~4-5k. - llama.cpp entonces reprocesa el prompt completo:
n_tokens = 4750 prompt eval time = 222411 ms / 44016 tokens. - El uso de caché alcanza 4676 MiB, superando el límite configurado (2500 MiB).
Configuración actual
llama-server --ctx-size 150000 --parallel 1 --ctx-checkpoints 32 --cache-ram 2500 --cache-reuse 256 -no-kvu --no-context-shiftCausas sospechadas
- Invalidación de caché por desbordamiento del límite
--cache-ram– el registro muestra 4676 MiB usados frente al límite de 2500 MiB. - Mecanismo de reúso de KV defectuoso cuando los tokens iniciales del prompt cambian (posiblemente alteraciones frecuentes por opencode).
--ctx-checkpointso--cache-reuseinsuficientes para el tamaño de contexto de 150k.
Recomendaciones de la comunidad
El hilo tiene pocas respuestas hasta ahora, pero los primeros pasos obvios incluyen aumentar --cache-ram para igualar el uso típico (por ejemplo, 5000+ MiB), o reducir --ctx-size para mantenerse por debajo del límite de caché. También verificar si opencode está mutando intencionalmente los prefijos de prompt; de ser así, bloquear el prompt del sistema o usar un prefijo fijo podría mejorar el reúso.
Para desarrolladores que ejecuten configuraciones similares, compartan sus configuraciones funcionales en el hilo de origen.
📖 Leer la fuente completa: r/LocalLLaMA
👀 Ver también

Usar HTML como lenguaje principal de chat para agentes de codificación de IA para permitir diagramas SVG
Un desarrollador cambió las indicaciones del sistema del agente de codificación de Markdown a HTML, permitiendo que los agentes rendericen diagramas SVG y tablas directamente en el chat. Usando Qwen3.6-27B con una interfaz HTML-first.

Orquestración Multi-Agente en OpenClaw: Centralizar Reglas, Generar Sub-Agentes
Un usuario de OpenClaw describe cómo pasó de tener instrucciones duplicadas en los espacios de trabajo a un único agente principal que genera subagentes, aplicando reglas arquitectónicas (por ejemplo, persistir datos estructurados como .JSON) en todos los espacios de trabajo de los agentes.

OpenClaw en M4 Pro: Encontrando barreras con el uso del navegador, el uso de la computadora y Codex
Un usuario reporta agentes atascados en bucles de terminal, bloqueados en sitios web y salidas de Codex defectuosas, buscando ajustes de configuración para el navegador de automatización, control de la GUI de macOS y bucles de interrupción.

El buen desarrollo asistido por IA ocurre a nivel de sistemas, no a nivel de tareas
Un usuario de Reddit explica cómo pasar de corregir el resultado del agente de IA a diseñar restricciones, como una regla de linter que obliga a la navegación por la interfaz, previene permanentemente clases enteras de errores.