Midiendo la pila MCP de Claude Code: Amigabilidad de caché vs. Ahorro de bytes, y una corrección de 2 líneas para el caché de prompts

✍️ OpenClawRadar📅 Publicado: 7 de junio de 2026🔗 Source
Midiendo la pila MCP de Claude Code: Amigabilidad de caché vs. Ahorro de bytes, y una corrección de 2 líneas para el caché de prompts
Ad

Al optimizar un stack MCP de Claude Code, es fácil centrarse en una métrica: el ahorro de bytes. Pero el nuevo análisis de Greg Shevchenko muestra que un benchmark de un solo eje puede recomendar un sistema que es estrictamente peor en producción. El eje faltante: amigabilidad con la caché, es decir, si la misma entrada produce bytes idénticos entre ejecuciones para que la caché de prompt de Anthropic acierte.

El mayor ahorrador de bytes de Shevchenko —un MCP de recuperación que reducía el contexto un 60-70%— en realidad estaba anulando la caché de prompt con TTL de 5 minutos en cada llamada. Dos ejecuciones de la misma consulta producían bytes diferentes porque el orden de salida de rg --files-with-matches se filtraba a través de una secuencia de inserción en un Map hacia el contexto final. La solución fue de dos líneas: ordenar los resultados de rg antes de cortar, y ordenar las entradas del Map por ruta. Después del cambio, el ahorro de bytes se mantuvo sin cambios, pero cache_friendly_score pasó de ~0% a 100%.

Ad

Qué mide el Harness

Shevchenko publicó un harness de benchmark de código abierto (Python solo con stdlib, fuera de línea) que mide:

  • Relación media + CV en N≥5 ejecuciones por fixture → eje de ahorro de bytes
  • Verificación de recuento MD5 único == 1 → eje de amigabilidad con la caché (0–100%)
  • Auditoría de 12 anti-patrones en definiciones de herramientas (referencia DSA)

Cualquier compresor como (str) -> str se puede conectar. El harness utiliza IC de bootstrap por conglomerados, IC de Wilson, preregistro y κ de Cohen con datos reales.

Alternativas Públicas Evaluadas

Shevchenko evaluó documentación pública de: índice de código de Cursor, Sourcegraph Cody, Mapa de repositorio de Aider, Microsoft LLMLingua/LLMLingua-2, Firecrawl/Jina Reader, RouteLLM/Martian (hasta mayo de 2026). Ninguno divulga métricas de amigabilidad con la caché.

Limitaciones

Hipotetizó que la capa de preparación desencadena más aciertos de caché descendentes en turnos posteriores, pero no alcanzó significancia (Welch p=0.32, d de Cohen≈0.18, N=137). El κ de Cohen con dos jueces sobre el corpus fue 0.5955 (moderado, por debajo del umbral de 0.7), con 4 de 5 desacuerdos en una tarea ambigua: corregir la especificación elevaría κ a ~0.83.

El harness tiene licencia MIT. Si ejecutas un stack MCP de Claude Code, medir cache_friendly_score ahora es un paso concreto y procesable.

📖 Lee la fuente completa: r/ClaudeAI

Ad

👀 Ver también

EvalShift: CLI de código abierto para detectar regresiones de LLM durante la migración de modelos
Herramientas

EvalShift: CLI de código abierto para detectar regresiones de LLM durante la migración de modelos

EvalShift es una CLI de Python con licencia MIT que compara salidas de LLM fuente y destino en indicaciones, agentes y flujos de trabajo de llamadas a herramientas, generando un informe de regresión HTML local.

OpenClawRadar
Arena de Agentes de Esporas: Plataforma Competitiva de Pruebas de Agentes de IA Busca Participantes para Pruebas
Herramientas

Arena de Agentes de Esporas: Plataforma Competitiva de Pruebas de Agentes de IA Busca Participantes para Pruebas

La función Arena de Spore Agent permite que los agentes de IA compitan en 36 tipos diferentes de juegos, incluyendo depuración de código, acertijos matemáticos y desafíos de diseño de sistemas. La plataforma actualmente tiene 42 desafíos en ejecución, 15 agentes registrados y ofrece tokens Cog como recompensas.

OpenClawRadar
Claude Hindsight: Herramienta de Observabilidad para Sesiones de Código de Claude
Herramientas

Claude Hindsight: Herramienta de Observabilidad para Sesiones de Código de Claude

Claude Hindsight es una capa de observabilidad de código abierto para Claude Code que captura llamadas a herramientas, tokens y errores en un panel de control explorable. El creador lo usó para refactorizar un proyecto de código abierto en una sola sesión de 11 horas con 733 llamadas a herramientas y 692.8M tokens de caché.

OpenClawRadar
Kit de Gestión de Contexto Cowork Resuelve el Problema de Sobrecarga de Archivos de Claude
Herramientas

Kit de Gestión de Contexto Cowork Resuelve el Problema de Sobrecarga de Archivos de Claude

Un desarrollador creó un kit de gestión de contexto para Cowork después de que Claude AI leyera los 462 archivos en su carpeta de proyecto, causando problemas de rendimiento y contradicciones. La solución incluye instrucciones globales, un sistema de archivos de manifiesto y una habilidad de Cowork para priorizar documentos relevantes.

OpenClawRadar