Project Headroom: La herramienta de código abierto de un ingeniero de Netflix reduce los costos de tokens de IA en un 90%

Tejas Chopra, ingeniero senior de Netflix, lanzó como código abierto Project Headroom, un proxy local que comprime la entrada de la ventana de contexto antes de que llegue al LLM. Las estimaciones iniciales indican que hasta un 90% de los tokens son redundantes y, desde enero de 2026, la herramienta ha ahorrado a los usuarios un total de $700,000 en 200 mil millones de tokens.
Cómo funciona
Headroom se ejecuta como un proxy en el puerto 8787 de la máquina del desarrollador. Se envuelve la CLI del LLM con el comando headroom wrap, por ejemplo:
headroom wrap codexAnaliza toda la entrada (historial de conversación, registros, salidas de herramientas, archivos, fragmentos de RAG) y aplica una compresión sin pérdidas y reversible. Es especialmente eficaz reduciendo:
- Registros del servidor: descarta el 90%
- Salidas de herramientas MCP: 70% de JSON redundante
- Salidas de bases de datos: esquemas repetitivos
- Árboles de archivos: metadatos repetidos
Desarrollado en Python y Node, la versión actual de Headroom es la v0.22 con 2,000 estrellas en GitHub y 120 bifurcaciones.
Por qué es importante
Chopra se inspiró en una factura de $287 de Claude Sonnet por depuración y refactorización rutinarias. Descubrió que el culpable no eran sus instrucciones, sino el código repetitivo, los esquemas JSON y los metadatos de máquina. "Esto no es prosa. Esto no es escritura creativa. Esto son datos comprimibles disfrazados de texto", escribió.
Por defecto, el TTL de la caché de prefijo de Claude es de solo cinco minutos; tras inactividad, todo el contexto se actualiza. Se puede establecer un TTL más largo, pero se paga el doble por las escrituras para ahorrar un 90% en las lecturas. Headroom evita esas compensaciones.
Alternativas
Existen otras herramientas: RTK (Rust Token Killer) recorta la salida verbosa de comandos, y LeanCTX es una variante. Opciones comerciales como Token Company (financiada por Y Combinator) ofrecen compresión como servicio. Pero la característica clave de Headroom es la compresión reversible y mantenerse dentro del flujo de trabajo del desarrollador.
📖 Lea la fuente completa: HN AI Agents
👀 Ver también

Memorine: Un Sistema de Memoria Local para Agentes OpenClaw Utilizando Python y SQLite
Memorine es un sistema de memoria local para agentes OpenClaw que utiliza únicamente Python y SQLite, sin dependencias externas, llamadas a API o telemetría. Proporciona almacenamiento de hechos con búsqueda de texto completo, desvanecimiento de memoria, detección de contradicciones, encadenamiento causal de eventos y búsqueda semántica opcional mediante fastembed y sqlite-vec.

Herramienta Local de Crítico de Imágenes con IA Utiliza Modelos de Visión Ollama para Retroalimentación
Un desarrollador ha creado una aplicación de escritorio gratuita que analiza imágenes generadas por IA localmente utilizando modelos de visión de Ollama. La herramienta proporciona informes de retroalimentación estructurados que incluyen sugerencias de mejora y actualizaciones de prompts.

Historial de Archivos de Claude: Extensión de VS Code para Seguimiento de Sesiones de Código de Claude
Una extensión de VS Code llamada Claude File History rastrea cada sesión de Claude Code que ha interactuado con tus archivos, permitiéndote encontrar conversaciones pasadas, previsualizar lo que se discutió y reanudar conversaciones con un doble clic.

Cómo Mendral redujo los costos de LLM al actualizar a Opus: Patrón de Triaje, Acceso SQL y Arquitectura de Subagentes
Mendral pasó de Sonnet a Opus 4.6 para el análisis de fallos de CI, pero redujo costos mediante el uso de un triador Haiku que desvía el 80% de los fallos, dando a los agentes acceso SQL a ClickHouse en lugar de enviar registros, y generando subagentes baratos para hacer la investigación real.