Project Headroom: Open-Source-Tool eines Netflix-Ingenieurs senkt KI-Token-Kosten um 90%

Netflix-Senioringenieur Tejas Chopra hat Project Headroom als Open Source veröffentlicht, einen lokalen Proxy, der die Kontextfenster-Eingabe komprimiert, bevor sie das LLM erreicht. Ersten Schätzungen zufolge sind bis zu 90% der Token redundant — und seit Januar 2026 hat das Tool den Nutzern insgesamt 700.000 US-Dollar bei 200 Milliarden Token gespart.
So funktioniert es
Headroom läuft als Proxy auf Port 8787 auf dem Entwicklerrechner. Sie umschließen Ihr LLM-CLI mit dem Befehl headroom wrap, z.B.:
headroom wrap codexEs analysiert alle Eingaben – Gesprächsverlauf, Logs, Toolausgaben, Dateien, RAG-Chunks – und wendet eine verlustfreie, reversible Komprimierung an. Am besten reduziert es:
- Server-Logs: 90% werden verworfen
- MCP-Toolausgaben: 70% redundantes JSON
- Datenbankausgaben: sich wiederholende Schemata
- Dateibäume: wiederholte Metadaten
Headroom ist in Python und Node entwickelt, die aktuelle Version ist v0.22 mit 2.000 GitHub-Sternen und 120 Forks.
Warum es wichtig ist
Chopra wurde von einer 287-Dollar-Claude-Sonnet-Rechnung für routinemäßiges Debugging und Refactoring inspiriert. Er fand heraus, dass der Übeltäter nicht seine Anweisungen waren – es waren Boilerplate, JSON-Schemata und Maschinenmetadaten. „Das ist keine Prosa. Das ist kein kreatives Schreiben. Das sind komprimierbare Daten, die sich als Text tarnen“, schrieb er.
Standardmäßig beträgt die TTL des Claude-Präfix-Cache nur fünf Minuten; bei Inaktivität wird der gesamte Kontext aktualisiert. Sie können eine längere TTL einstellen, zahlen dann aber das Doppelte für Schreibvorgänge, um 90% bei Lesevorgängen zu sparen. Headroom umgeht diese Kompromisse.
Alternativen
Es gibt andere Tools: RTK (Rust Token Killer) kürzt ausführliche Befehlsausgaben, und LeanCTX ist eine Variante. Kommerzielle Optionen wie Token Company (von Y Combinator finanziert) bieten Compression-as-a-Service. Aber Headrooms Hauptmerkmal ist die reversible Komprimierung und der Verbleib im Workflow des Entwicklers.
📖 Vollständige Quelle lesen: HN AI Agents
👀 Siehe auch

Die Browsererweiterung "wearehere" scannt Websites auf Tracking- und Datenschutzrisiken.
wearehere ist eine Browser-Erweiterung, die Websites in zehn Kategorien wie Cookies, Tracker, Geräte-Fingerprinting und Dark Patterns scannt und sie basierend auf Datenschutzrisiken bewertet. Sie ist unter 200KB groß, läuft lokal im Browser und ist auch als npm-Paket für die Integration mit KI-Agenten über den barebrowse MCP-Server verfügbar.

Einführung von cltree: Ein Dateibaum-TUI für Claude-Code
<strong>cltree</strong> ist eine Split-Pane Terminalbenutzeroberfläche (TUI), die entwickelt wurde, um neben Claude Code zu laufen. Sie löst die Herausforderung, Projektstrukturen in Echtzeit anzuzeigen, während Claude Code im Terminal verwendet wird.

Heren Godot MCP: Persistenter WebSocket-Daemon reduziert KI-Godot-Interaktionslatenz auf ~20ms
Heren ist ein neuer MCP-Server für Godot, der einen leichtgewichtigen WebSocket-Daemon am Leben hält und Operationen in etwa 20 ms ermöglicht, anstatt auf vollständige Engine-Kaltstarts zu warten. Er bietet 15 Werkzeuge für Szenenverwaltung, Debugging, GPU-beschleunigte Screenshots und automatische Abschaltung nach 3 Minuten Inaktivität.

Atlarix v5.1 fügt Cloud-Tiering hinzu, während die lokale KI-Codeunterstützung erhalten bleibt.
Atlarix v5.1.0 führt Compass-Cloud-Tarife für den sofortigen Einsatz ein und behält dabei die volle Unterstützung für Ollama und LM Studio bei. Die IDE verwendet einen persistenten SQLite-Graphen namens Blueprint, um lokalen Modellen präzisen Kontext zu liefern.