Claude Code Plugin Analiza el Desperdicio de Tokens y Anomalías Localmente

Un desarrollador ha creado un complemento de Claude Code llamado claude-token-analyzer que diagnostica el desperdicio de tokens en sesiones de Claude Code mediante el análisis de datos locales. La herramienta detecta seis tipos específicos de anomalías: HighCost, LowCacheHitRate, CostInefficient, ExcessiveToolUse, HighTokenUsage y UnusualModelMix, cada una con puntuación de severidad para priorizar correcciones.
Cómo funciona
El complemento está construido como un servidor MCP en Rust que analiza datos de sesiones de Claude Code desde archivos ~/.claude/projects/**/*.jsonl hacia una base de datos SQLite local. Realiza análisis estadístico utilizando umbrales de desviación estándar y detección compuesta de anomalías. El sistema es completamente local sin componentes en la nube ni telemetría.
Lo que encontró
Al escanear 8.392 sesiones se revelaron 1.015 anomalías:
- ExcessiveToolUse fue la más común (320 sesiones) - muchas más llamadas a herramientas de lo típico
- LowCacheHitRate afectó 261 sesiones - los prompts se reenviaron sin almacenamiento en caché
- 66 sesiones fueron "cost-inefficient" - alto costo combinado con baja tasa de aciertos en caché
Instalación y uso
Instalar con: claude plugin install claude-token-analyzer
Después de la instalación, puedes preguntarle a Claude:
- "cta"
- "how much did I spend?"
- "scan for anomalies"
El complemento expone 7 herramientas MCP y 6 habilidades de flujo de trabajo. También incluye habilidades de flujo de trabajo en chino tradicional - puedes ingresar "看看狀況", "這個月花多少" o "有異常嗎" para informes de análisis en chino.
La herramienta está disponible en GitHub en https://github.com/li195111/claude-token-analyzer bajo Licencia MIT.
📖 Read the full source: r/ClaudeAI
👀 Ver también

Freddy CLI: Conecta Datos de Salud a Agentes de IA vía MCP
Freddy publica una CLI de código abierto para conectar datos de salud portátiles (Oura, Polar, Withings, etc.) a agentes de IA mediante MCP. Incluye comandos para flujo OAuth, consulta de datos y renovación de tokens.

Arquitectura de Compilador Determinista para Flujos de Trabajo de LLM de Múltiples Pasos Muestra Fuertes Resultados en Puntos de Referencia
Una arquitectura de compilación determinista para flujos de trabajo estructurados de LLM utiliza registros de nodos tipados, contratos de parámetros y validación estática para compilar grafos de flujo de trabajo con antelación. Los puntos de referencia muestran que supera a GPT-4.1 y Claude Sonnet 4.6 en profundidades de flujo de trabajo de 3 a 12+ nodos.

Backend personalizado de llama.cpp descarga la multiplicación de matrices de LLM a la NPU AMD XDNA2 en Ryzen AI MAX 385
Un desarrollador creó un backend personalizado de llama.cpp que envía operaciones GEMM directamente al NPU AMD XDNA2 en Ryzen AI MAX 385 (Strix Halo), logrando 43.7 t/s de decodificación a 0.947 J/tok con Meta-Llama-3.1-8B-Instruct Q4_K_M. La ruta de decodificación del NPU ahorra ~10W en comparación con solo Vulkan, manteniendo el rendimiento de decodificación.

Skillware agrega prompt_rewriter para la compresión determinista de tokens en bucles de agentes de la API de Claude.
Skillware ha fusionado una nueva habilidad de reescritura de prompts que comprime los prompts entre un 50-80% antes de enviarlos a la API de Claude, reduciendo costos en bucles agenticos mientras mantiene un comportamiento estable mediante compresión determinista.