llama.cpp Reprocesamiento Masivo de Prompts con Agentes de Codificación: Depuración de Caché KV e Intercambio de Contexto

✍️ OpenClawRadar📅 Publicado: 14 de mayo de 2026🔗 Source
llama.cpp Reprocesamiento Masivo de Prompts con Agentes de Codificación: Depuración de Caché KV e Intercambio de Contexto
Ad

Un desarrollador en r/LocalLLaMA se encuentra con un grave problema de rendimiento con llama.cpp al ejecutar agentes de codificación de contexto largo (opencode + pi.dev) a través de llama-swap. Incluso con prompts muy similares (similitud LCP a menudo >0,99), el sistema descarta periódicamente la caché KV y reprocesa más de 40k tokens, lo que provoca un TTFT de varios minutos.

Comportamiento observado

  • El contexto crece hasta 50k+ tokens.
  • Después de varios reúsos normales (por ejemplo, prompt eval time = 473 ms / 19 tokens), n_past cae repentinamente a ~4-5k.
  • llama.cpp entonces reprocesa el prompt completo: n_tokens = 4750 prompt eval time = 222411 ms / 44016 tokens.
  • El uso de caché alcanza 4676 MiB, superando el límite configurado (2500 MiB).

Configuración actual

llama-server --ctx-size 150000 --parallel 1 --ctx-checkpoints 32 --cache-ram 2500 --cache-reuse 256 -no-kvu --no-context-shift
Ad

Causas sospechadas

  • Invalidación de caché por desbordamiento del límite --cache-ram – el registro muestra 4676 MiB usados frente al límite de 2500 MiB.
  • Mecanismo de reúso de KV defectuoso cuando los tokens iniciales del prompt cambian (posiblemente alteraciones frecuentes por opencode).
  • --ctx-checkpoints o --cache-reuse insuficientes para el tamaño de contexto de 150k.

Recomendaciones de la comunidad

El hilo tiene pocas respuestas hasta ahora, pero los primeros pasos obvios incluyen aumentar --cache-ram para igualar el uso típico (por ejemplo, 5000+ MiB), o reducir --ctx-size para mantenerse por debajo del límite de caché. También verificar si opencode está mutando intencionalmente los prefijos de prompt; de ser así, bloquear el prompt del sistema o usar un prefijo fijo podría mejorar el reúso.

Para desarrolladores que ejecuten configuraciones similares, compartan sus configuraciones funcionales en el hilo de origen.

📖 Leer la fuente completa: r/LocalLLaMA

Ad

👀 Ver también

Usar HTML como lenguaje principal de chat para agentes de codificación de IA para permitir diagramas SVG
Consejos

Usar HTML como lenguaje principal de chat para agentes de codificación de IA para permitir diagramas SVG

Un desarrollador cambió las indicaciones del sistema del agente de codificación de Markdown a HTML, permitiendo que los agentes rendericen diagramas SVG y tablas directamente en el chat. Usando Qwen3.6-27B con una interfaz HTML-first.

OpenClawRadar
Orquestración Multi-Agente en OpenClaw: Centralizar Reglas, Generar Sub-Agentes
Consejos

Orquestración Multi-Agente en OpenClaw: Centralizar Reglas, Generar Sub-Agentes

Un usuario de OpenClaw describe cómo pasó de tener instrucciones duplicadas en los espacios de trabajo a un único agente principal que genera subagentes, aplicando reglas arquitectónicas (por ejemplo, persistir datos estructurados como .JSON) en todos los espacios de trabajo de los agentes.

OpenClawRadar
OpenClaw en M4 Pro: Encontrando barreras con el uso del navegador, el uso de la computadora y Codex
Consejos

OpenClaw en M4 Pro: Encontrando barreras con el uso del navegador, el uso de la computadora y Codex

Un usuario reporta agentes atascados en bucles de terminal, bloqueados en sitios web y salidas de Codex defectuosas, buscando ajustes de configuración para el navegador de automatización, control de la GUI de macOS y bucles de interrupción.

OpenClawRadar
El buen desarrollo asistido por IA ocurre a nivel de sistemas, no a nivel de tareas
Consejos

El buen desarrollo asistido por IA ocurre a nivel de sistemas, no a nivel de tareas

Un usuario de Reddit explica cómo pasar de corregir el resultado del agente de IA a diseñar restricciones, como una regla de linter que obliga a la navegación por la interfaz, previene permanentemente clases enteras de errores.

OpenClawRadar