Project Headroom: La herramienta de código abierto de un ingeniero de Netflix reduce los costos de tokens de IA en un 90%

✍️ OpenClawRadar📅 Publicado: 2 de junio de 2026🔗 Source
Project Headroom: La herramienta de código abierto de un ingeniero de Netflix reduce los costos de tokens de IA en un 90%
Ad

Tejas Chopra, ingeniero senior de Netflix, lanzó como código abierto Project Headroom, un proxy local que comprime la entrada de la ventana de contexto antes de que llegue al LLM. Las estimaciones iniciales indican que hasta un 90% de los tokens son redundantes y, desde enero de 2026, la herramienta ha ahorrado a los usuarios un total de $700,000 en 200 mil millones de tokens.

Cómo funciona

Headroom se ejecuta como un proxy en el puerto 8787 de la máquina del desarrollador. Se envuelve la CLI del LLM con el comando headroom wrap, por ejemplo:

headroom wrap codex

Analiza toda la entrada (historial de conversación, registros, salidas de herramientas, archivos, fragmentos de RAG) y aplica una compresión sin pérdidas y reversible. Es especialmente eficaz reduciendo:

  • Registros del servidor: descarta el 90%
  • Salidas de herramientas MCP: 70% de JSON redundante
  • Salidas de bases de datos: esquemas repetitivos
  • Árboles de archivos: metadatos repetidos

Desarrollado en Python y Node, la versión actual de Headroom es la v0.22 con 2,000 estrellas en GitHub y 120 bifurcaciones.

Ad

Por qué es importante

Chopra se inspiró en una factura de $287 de Claude Sonnet por depuración y refactorización rutinarias. Descubrió que el culpable no eran sus instrucciones, sino el código repetitivo, los esquemas JSON y los metadatos de máquina. "Esto no es prosa. Esto no es escritura creativa. Esto son datos comprimibles disfrazados de texto", escribió.

Por defecto, el TTL de la caché de prefijo de Claude es de solo cinco minutos; tras inactividad, todo el contexto se actualiza. Se puede establecer un TTL más largo, pero se paga el doble por las escrituras para ahorrar un 90% en las lecturas. Headroom evita esas compensaciones.

Alternativas

Existen otras herramientas: RTK (Rust Token Killer) recorta la salida verbosa de comandos, y LeanCTX es una variante. Opciones comerciales como Token Company (financiada por Y Combinator) ofrecen compresión como servicio. Pero la característica clave de Headroom es la compresión reversible y mantenerse dentro del flujo de trabajo del desarrollador.

📖 Lea la fuente completa: HN AI Agents

Ad

👀 Ver también

Holaboss AI Runtime se traslada a TypeScript, implementa puertos MCP persistentes.
Herramientas

Holaboss AI Runtime se traslada a TypeScript, implementa puertos MCP persistentes.

El entorno de ejecución del agente local Holaboss AI ha sido reestructurado para usar TypeScript exclusivamente, eliminando dependencias de Python y reduciendo el tamaño del paquete. Ahora persiste los puertos del servidor MCP en SQLite con restricciones UNIQUE(port) para evitar colisiones entre reinicios.

OpenClawRadar
AgentHandover: Aplicación de la barra de menú de Mac que crea habilidades de agente observando tu pantalla
Herramientas

AgentHandover: Aplicación de la barra de menú de Mac que crea habilidades de agente observando tu pantalla

AgentHandover es una aplicación de código abierto para la barra de menú de Mac que utiliza Gemma 4 ejecutándose localmente a través de Ollama para observar tu pantalla y convertir flujos de trabajo repetidos en archivos de Habilidades estructurados que cualquier agente puede seguir. Ofrece tanto Grabación Enfocada para tareas específicas como Descubrimiento Pasivo que detecta patrones a partir de la observación en segundo plano.

OpenClawRadar
soul.py agrega memoria persistente a LLMs locales con un enfoque simple basado en archivos.
Herramientas

soul.py agrega memoria persistente a LLMs locales con un enfoque simple basado en archivos.

soul.py es una biblioteca de Python que añade memoria persistente a cualquier LLM utilizando dos archivos markdown para identidad y registro de conversaciones, funcionando con modelos de Ollama, OpenAI y Anthropic sin requerir bases de datos o servidores.

OpenClawRadar
El Hollow AgentOS reduce el uso de tokens de código de Claude en un 68.5% con un sistema operativo nativo en JSON para agentes de IA.
Herramientas

El Hollow AgentOS reduce el uso de tokens de código de Claude en un 68.5% con un sistema operativo nativo en JSON para agentes de IA.

Hollow AgentOS es un sistema operativo nativo en JSON diseñado específicamente para agentes de IA que reduce el uso de tokens en Claude Code en un 68.5% al eliminar la sobrecarga ineficiente de comandos de shell. Se conecta a Claude Code mediante MCP, ejecuta inferencia local a través de Ollama y tiene licencia MIT.

OpenClawRadar