El PTC construido por usuarios para Claude Code muestra un ahorro de tokens del 40-65% en tareas de análisis, no en escritura de código.

Un desarrollador ha construido una implementación local de Llamadas a Herramientas Programáticas (PTC) para Claude Code y analizó 79 sesiones de uso real para medir los beneficios reales. PTC difiere de las llamadas a herramientas normales porque el agente escribe código que se ejecuta en un entorno aislado, con solo los resultados finales ingresando a la ventana de contexto en lugar de cada paso intermedio.
Qué se construyó
El desarrollador creó Thalamus, un servidor MCP local que proporciona capacidad similar a PTC para Claude Code. Incluye cuatro herramientas: execute() (ejecuta Python con primitivas), search, remember y context. La implementación tiene 143 pruebas, usa solo la biblioteca estándar de Python y se ejecuta completamente de forma local. El desarrollador enfatiza que esta es su propia implementación, no la PTC oficial de Anthropic.
Resultados medidos de 79 sesiones
- Huella de tokens por llamada:
execute()promedió ~2,600 caracteres frente aReadque promedió ~4,400 caracteres - Reducción de tamaño JSONL: Las sesiones que usaron PTC mostraron una reducción de tamaño del -15.6%
- Ahorros en tareas de análisis/investigación: 40-65%
- Ahorros en tareas de escritura de código: ~0%
El desarrollador señala que estos números del mundo real están "lejos del 98%" de ahorros reportados en escenarios óptimos por Anthropic y Cloudflare.
Cómo el agente realmente usa execute()
El análisis de contenido de 112 llamadas a execute() reveló:
- 64% usó Python estándar (os.walk, open, sqlite3, subprocess) — no las primitivas PTC
- 30% usó una sola primitiva (un fs.read o fs.grep)
- 5% hizo agrupación real (2+ primitivas combinadas)
El patrón "reemplazar 5 Reads con 1 execute" ocurrió en solo el 5% del uso real. El agente usó principalmente execute() como un entorno de computación de propósito general para acceder a archivos fuera del proyecto, ejecutar agregaciones y consultar bases de datos.
Patrones de adopción
La medición inicial mostró que solo el 25% de las sesiones usaron PTC, con el agente usando por defecto Read/Grep/Glob. Después de agregar un manual operativo de ~1,100 tokens a CLAUDE.md, la adopción saltó al 42.9%. Las sesiones enfocadas en escribir código (Edit + Bash dominantes) mostraron cero uso de PTC.
El desarrollador concluye que PTC brilla en análisis, depuración y tareas de investigación entre archivos, pero no en flujos de trabajo de desarrollo con mucho contenido de edición.
📖 Read the full source: r/ClaudeAI
👀 Ver también

Mi Agente Construyó Su Propio Sistema de Interocepción — Ahora Tiene Deseos

EvalShift: CLI de código abierto para detectar regresiones de LLM durante la migración de modelos
EvalShift es una CLI de Python con licencia MIT que compara salidas de LLM fuente y destino en indicaciones, agentes y flujos de trabajo de llamadas a herramientas, generando un informe de regresión HTML local.

Servidor MCP de Soul Agrega Memoria Persistente y Seguridad para LLMs Locales
Soul es un servidor MCP de código abierto que proporciona memoria persistente entre sesiones para LLMs locales con dos comandos: n2_boot al inicio y n2_work_end al final. Incluye características de seguridad Ark que bloquean comandos peligrosos como rm -rf y DROP DATABASE sin costo de tokens, además de configuración de almacenamiento en la nube.

Resultados del Benchmark de Pruebas APEX: Rendimiento de Qwen 3.5 en Tareas de Programación Reales
Los resultados del benchmark APEX Testing muestran el rendimiento de los modelos Qwen 3.5 en 70 tareas de programación reales de GitHub, con la versión de 397B cayendo a 1194 ELO en tareas de nivel maestro, mientras que GLM-4.7 cuantizado lidera los modelos locales con 1572 ELO.