CLAUDE.md: El archivo de reemplazo reduce los tokens de salida de Claude en un 63%

Qué hace CLAUDE.md
CLAUDE.md es un archivo único que colocas en la raíz de tu proyecto. Cuando Claude Code lo lee, el comportamiento cambia inmediatamente sin modificaciones de código. Se enfoca específicamente en el comportamiento de salida: adulación, verbosidad y ruido de formato.
El problema que aborda
Por defecto, Claude desperdicia tokens en comportamientos que no agregan valor:
- Inicia respuestas con "¡Claro!", "¡Excelente pregunta!", "¡Absolutamente!"
- Termina con "¡Espero que esto ayude! ¡Avísame si necesitas algo!"
- Usa guiones largos (--), comillas inteligentes, caracteres Unicode que rompen analizadores
- Replantea tu pregunta antes de responder
- Añade sugerencias no solicitadas más allá de lo que pediste
- Sobre-ingenieriza código con abstracciones innecesarias
- Está de acuerdo con afirmaciones incorrectas ("¡Tienes toda la razón!")
Resultados de referencia
Las mismas 5 consultas probadas sin CLAUDE.md (línea base) y con CLAUDE.md (optimizado):
- Explicar async/await: 180 palabras → 65 palabras (reducción del 64%)
- Revisión de código: 120 palabras → 30 palabras (reducción del 75%)
- Qué es una API REST: 110 palabras → 55 palabras (reducción del 50%)
- Corrección de alucinación: 55 palabras → 20 palabras (reducción del 64%)
- Total: 465 palabras → 170 palabras (reducción del 63%)
Aproximadamente 384 tokens de salida ahorrados por cada 4 consultas. Nota: Esto es un indicador direccional de 5 consultas, no un estudio estadísticamente controlado.
Cuándo ayuda vs. cuándo no
Funciona mejor para:
- Canalizaciones de automatización con alto volumen de salida (bots de currículum, bucles de agentes, generación de código)
- Tareas estructuradas repetidas donde la verbosidad predeterminada de Claude se acumula en cientos de llamadas
- Equipos que necesitan formato de salida consistente y analizable entre sesiones
No vale la pena para:
- Consultas únicas cortas (el archivo se carga en contexto en cada mensaje, causando aumento neto de tokens en intercambios de baja salida)
- Uso casual ocasional (la sobrecarga no se compensa con bajo volumen)
- Corregir modos de fallo profundos como implementaciones alucinadas o deriva arquitectónica
- Canalizaciones que usan múltiples sesiones nuevas por tarea
- Fiabilidad del analizador a escala (usa salidas estructuradas como modo JSON en su lugar)
- Trabajo exploratorio o arquitectónico donde el debate y las alternativas son el objetivo
Consideraciones de costo
El archivo CLAUDE.md en sí consume tokens de entrada en cada mensaje. Los ahorros provienen de tokens de salida reducidos. El beneficio neto es positivo solo cuando el volumen de salida es lo suficientemente alto para compensar el costo persistente de entrada. Con bajo uso, cuesta más de lo que ahorra.
Soporte de modelos
Las referencias se ejecutaron solo en Claude. Las reglas son independientes del modelo y deberían funcionar en cualquier modelo que lea contexto, pero los resultados en modelos locales como llama.cpp, Mistral u otros no están probados.
📖 Read the full source: HN AI Agents
👀 Ver también

Configuración de OpenClaw sin Interfaz Gráfica con Discord mediante Scripts Docker
Un repositorio de GitHub proporciona scripts para ejecutar OpenClaw con Discord en un contenedor Docker sin interfaz gráfica, evitando la TUI/WebUI. Incluye un script de gestión con comandos como claw init, start y stop, además de soporte preconfigurado para OpenAI Responses API, Chromium y varias herramientas.

Planificación de modo de refactorización Claude Code Prompt Improver v0.5.3 e investigación priorizando subagentes
v0.5.3 añade un hook PreToolUse para mejorar la legibilidad del modo plan (reescrituras limpias, sin historial de decisiones) y traslada la investigación de prompts vagos a subagentes Task/Explore en Haiku para ahorrar tokens del contexto principal. El plugin ahora funciona en Windows y tiene más de 1.4K estrellas en GitHub.
UI y Servidor para Autoencoders de Lenguaje Natural de Anthropic en llama.cpp
Un servidor personalizado de llama.cpp y una interfaz Mikupad para los Autoencoders de Lenguaje Natural (NLAs) de peso abierto de Anthropic, que admiten extracción de activaciones, explicación, reconstrucción y dirección mediante edición de explicaciones.

Brócoli: Plataforma de código abierto para ejecutar agentes de IA de programación a partir de tickets de Linear en entornos de pruebas en la nube
Broccoli es una herramienta de código abierto que toma tareas de programación de Linear, las ejecuta en entornos aislados en la nube usando Claude y Codex, y abre PRs para revisión humana. Se ejecuta en tu propia infraestructura de Google Cloud con despliegue de calidad de producción.