Projet Headroom : l'outil open source d'un ingénieur Netflix réduit de 90 % les coûts des jetons IA

Le senior ingénieur de Netflix, Tejas Chopra, a ouvert le code source de Project Headroom, un proxy local qui compresse les entrées de la fenêtre de contexte avant qu'elles n'atteignent le LLM. Les premières estimations indiquent que jusqu'à 90 % des tokens sont redondants — et depuis janvier 2026, l'outil a fait économiser aux utilisateurs un total de 700 000 $ sur 200 milliards de tokens.
Comment ça marche
Headroom fonctionne comme un proxy sur le port 8787 de la machine du développeur. Vous encapsulez votre CLI LLM avec la commande headroom wrap, par exemple :
headroom wrap codexIl analyse toutes les entrées — historique de conversation, journaux, sorties d'outils, fichiers, morceaux RAG — et applique une compression sans perte et réversible. Il est particulièrement efficace pour réduire :
- Les journaux serveur : 90 % éliminés
- Les sorties d'outils MCP : 70 % de JSON redondant
- Les sorties de base de données : schémas répétitifs
- Les arborescences de fichiers : métadonnées répétées
Développé en Python et Node, Headroom en est actuellement à la version v0.22 avec 2 000 étoiles GitHub et 120 forks.
Pourquoi c'est important
Chopra a été inspiré par une facture de 287 $ pour Claude Sonnet suite à du débogage et du refactoring de routine. Il a découvert que le coupable n'était pas ses instructions — mais le code standard, les schémas JSON et les métadonnées machine. « Ce n'est pas de la prose. Ce n'est pas de l'écriture créative. Ce sont des données compressibles déguisées en texte », a-t-il écrit.
Par défaut, le cache de préfixe de Claude a un TTL de seulement cinq minutes ; après une période d'inactivité, tout le contexte se rafraîchit. Vous pouvez définir un TTL plus long mais payer le double pour les écritures afin d'économiser 90 % sur les lectures. Headroom contourne ces compromis.
Alternatives
D'autres outils existent : RTK (Rust Token Killer) réduit les sorties de commandes verbeuses, et LeanCTX en est une variante. Des offres commerciales comme Token Company (financée par Y Combinator) proposent la compression en tant que service. Mais la caractéristique clé de Headroom est la compression réversible et le fait de rester dans le flux de travail du développeur.
📖 Lire la source complète : HN AI Agents
👀 See Also

Claude pour le travail de design : Comment arrêter de répéter les mêmes arguments de goût à chaque session
Un développeur utilisant Claude pour des projets clients décrit le problème central : Claude n'a aucune mémoire des décisions de design rejetées, ce qui conduit à des résultats génériques et à une identité de marque incohérente.

Compétence de Traduction Vidéo OpenClaw Disponible sur ClawHub
Une nouvelle compétence de traduction vidéo pour les agents OpenClaw permet aux utilisateurs de télécharger une vidéo ou de fournir une URL pour obtenir un aperçu traduit instantanément. La compétence est hébergée sur ClawHub.

AIBrain ajoute une mémoire persistante et une capacité d'auto-amélioration à Claude Code.
AIBrain est un outil qui donne à Claude Code une mémoire persistante entre les sessions grâce à une recherche sémantique et des cycles d'auto-amélioration. Il comprend 53 flux de travail, 44 compétences, 9 serveurs MCP et prend en charge le maillage multi-agent via Tailscale.

Claude Code Ultracode Mode génère un pipeline de 70 agents pour la recherche approfondie
Une seule requête 'deep search' en mode ultracode de Claude Code génère automatiquement un pipeline en 4 phases avec ~70 agents, chacun récupérant et recoupant les projets indépendamment. Le script d'orchestration maintient les résultats intermédiaires hors de la fenêtre de contexte, évitant ainsi une surcharge.