Project Headroom: Open-Source-Tool eines Netflix-Ingenieurs senkt KI-Token-Kosten um 90%

✍️ OpenClawRadar📅 Veröffentlicht: 2. Juni 2026🔗 Source
Project Headroom: Open-Source-Tool eines Netflix-Ingenieurs senkt KI-Token-Kosten um 90%
Ad

Netflix-Senioringenieur Tejas Chopra hat Project Headroom als Open Source veröffentlicht, einen lokalen Proxy, der die Kontextfenster-Eingabe komprimiert, bevor sie das LLM erreicht. Ersten Schätzungen zufolge sind bis zu 90% der Token redundant — und seit Januar 2026 hat das Tool den Nutzern insgesamt 700.000 US-Dollar bei 200 Milliarden Token gespart.

So funktioniert es

Headroom läuft als Proxy auf Port 8787 auf dem Entwicklerrechner. Sie umschließen Ihr LLM-CLI mit dem Befehl headroom wrap, z.B.:

headroom wrap codex

Es analysiert alle Eingaben – Gesprächsverlauf, Logs, Toolausgaben, Dateien, RAG-Chunks – und wendet eine verlustfreie, reversible Komprimierung an. Am besten reduziert es:

  • Server-Logs: 90% werden verworfen
  • MCP-Toolausgaben: 70% redundantes JSON
  • Datenbankausgaben: sich wiederholende Schemata
  • Dateibäume: wiederholte Metadaten

Headroom ist in Python und Node entwickelt, die aktuelle Version ist v0.22 mit 2.000 GitHub-Sternen und 120 Forks.

Ad

Warum es wichtig ist

Chopra wurde von einer 287-Dollar-Claude-Sonnet-Rechnung für routinemäßiges Debugging und Refactoring inspiriert. Er fand heraus, dass der Übeltäter nicht seine Anweisungen waren – es waren Boilerplate, JSON-Schemata und Maschinenmetadaten. „Das ist keine Prosa. Das ist kein kreatives Schreiben. Das sind komprimierbare Daten, die sich als Text tarnen“, schrieb er.

Standardmäßig beträgt die TTL des Claude-Präfix-Cache nur fünf Minuten; bei Inaktivität wird der gesamte Kontext aktualisiert. Sie können eine längere TTL einstellen, zahlen dann aber das Doppelte für Schreibvorgänge, um 90% bei Lesevorgängen zu sparen. Headroom umgeht diese Kompromisse.

Alternativen

Es gibt andere Tools: RTK (Rust Token Killer) kürzt ausführliche Befehlsausgaben, und LeanCTX ist eine Variante. Kommerzielle Optionen wie Token Company (von Y Combinator finanziert) bieten Compression-as-a-Service. Aber Headrooms Hauptmerkmal ist die reversible Komprimierung und der Verbleib im Workflow des Entwicklers.

📖 Vollständige Quelle lesen: HN AI Agents

Ad

👀 Siehe auch

Die Browsererweiterung "wearehere" scannt Websites auf Tracking- und Datenschutzrisiken.
Werkzeuge

Die Browsererweiterung "wearehere" scannt Websites auf Tracking- und Datenschutzrisiken.

wearehere ist eine Browser-Erweiterung, die Websites in zehn Kategorien wie Cookies, Tracker, Geräte-Fingerprinting und Dark Patterns scannt und sie basierend auf Datenschutzrisiken bewertet. Sie ist unter 200KB groß, läuft lokal im Browser und ist auch als npm-Paket für die Integration mit KI-Agenten über den barebrowse MCP-Server verfügbar.

OpenClawRadar
Einführung von cltree: Ein Dateibaum-TUI für Claude-Code
Werkzeuge

Einführung von cltree: Ein Dateibaum-TUI für Claude-Code

<strong>cltree</strong> ist eine Split-Pane Terminalbenutzeroberfläche (TUI), die entwickelt wurde, um neben Claude Code zu laufen. Sie löst die Herausforderung, Projektstrukturen in Echtzeit anzuzeigen, während Claude Code im Terminal verwendet wird.

OpenClawRadar
Heren Godot MCP: Persistenter WebSocket-Daemon reduziert KI-Godot-Interaktionslatenz auf ~20ms
Werkzeuge

Heren Godot MCP: Persistenter WebSocket-Daemon reduziert KI-Godot-Interaktionslatenz auf ~20ms

Heren ist ein neuer MCP-Server für Godot, der einen leichtgewichtigen WebSocket-Daemon am Leben hält und Operationen in etwa 20 ms ermöglicht, anstatt auf vollständige Engine-Kaltstarts zu warten. Er bietet 15 Werkzeuge für Szenenverwaltung, Debugging, GPU-beschleunigte Screenshots und automatische Abschaltung nach 3 Minuten Inaktivität.

OpenClawRadar
Atlarix v5.1 fügt Cloud-Tiering hinzu, während die lokale KI-Codeunterstützung erhalten bleibt.
Werkzeuge

Atlarix v5.1 fügt Cloud-Tiering hinzu, während die lokale KI-Codeunterstützung erhalten bleibt.

Atlarix v5.1.0 führt Compass-Cloud-Tarife für den sofortigen Einsatz ein und behält dabei die volle Unterstützung für Ollama und LM Studio bei. Die IDE verwendet einen persistenten SQLite-Graphen namens Blueprint, um lokalen Modellen präzisen Kontext zu liefern.

OpenClawRadar