CAL: Open-Source Kontextoptimierungsschicht für LLM-Agenten

Was CAL macht
CAL ist eine Python-Bibliothek, die zwischen Ihrem bestehenden Code und LLM-API-Aufrufen sitzt und für jede Anfrage intelligent Kontext auswählt, komprimiert und zusammenstellt. Sie adressiert die Kosten- und Kontextprobleme in tokenlastigen Agenten-Setups, was insbesondere mit den jüngsten Änderungen bei Claude Pro/Max-Abonnements relevant ist.
Leistungsbenchmarks
Im Produktionseinsatz mit Claude Opus 4 und 103 Kontextblöcken:
- Ohne CAL: Jede Anfrage sendet alle 103 Blöcke (~23.000 Tokens) zu $0,043 pro Anfrage
- Mit CAL: Reduziert auf ~6 Blöcke und 4.100 Tokens zu $0,008 pro Anfrage
- Ergebnisse: 83% Reduktion bei Tokens, 81% Reduktion bei Kosten
Validiert mit 5.000 WildChat-Prompts (einem offenen akademischen Datensatz realer LLM-Konversationen in 57 Sprachen) mit durchschnittlich 97,6% Einsparungen.
Hauptfunktionen
- Selector: IDF-gewichtetes Scoring wählt nur relevante Blöcke pro Abfrage aus. Verwendet stabiles Präfix + dynamische Blöcke, die pro Anfrage ausgewählt werden.
- Tool Stubs: Drei-stufiges Lazy Loading von Tools mit leichtgewichtigen Stubs, bis das Modell die Absicht signalisiert, ein bestimmtes Tool zu verwenden.
- Cost Engine: Anbieterbewusster Einsparungsrechner, der Anthropics 4 Eingabestufen und Googles Cache-Speicherpreise kennt.
- Noise Suppression: IDF-Floor + Require-Any-Gates, um zu verhindern, dass häufige Wörter bei jeder Anfrage irrelevante Blöcke laden.
- Cache-Stable Ordering: Verwendet Scores nur für die Auswahl, dann alphabetische Reihenfolge für die Position, um Cache-Treffer beizubehalten.
Technische Details
Mehrfach-Kontexthandhabung: Tool Stubs sind verlaufsbewusst. Wenn das Modell in einer vorherigen Runde ein Tool verwendet hat, bleibt das vollständige Schema geladen, um die Gesprächskontinuität aufrechtzuerhalten.
Anbieterunterstützung: CAL ist anbieterunabhängig und funktioniert mit jedem Anbieter, der einen Chat-Completions-Endpunkt hat. Die Cost Engine behandelt bereits Anthropics 4 Eingabestufen und Googles Cache-Speicherpreise.
Randfälle: Verwendet IDF-Floors und Rauschunterdrückung für mehrdeutige Abfragen. Hybrides Keyword+Semantik-Scoring ist in Planung.
Installation und Lizenzierung
pip install cal-context
MIT lizenziert. PyPI: https://pypi.org/project/cal-context/
GitHub: https://github.com/vjc-lab/context-assembly-layer
📖 Read the full source: r/openclaw
👀 Siehe auch

Ausführen von NemoClaw mit lokalem vLLM: Setup-Notizen und Beobachtungen zum Agent-Engineering
Ein Entwickler dokumentierte die Ausführung von NVIDIAs sandboxed AI-Agentenplattform NemoClaw mit einem lokalen Nemotron 9B v2-Modell über vLLM auf WSL2. Zu den wichtigsten Erkenntnissen gehören Details zum Inferenz-Routing, Kompatibilitätsprobleme mit Parsern und Beobachtungen zur Kluft in der Agentenentwicklung.

Audacity MCP Server gibt Claude AI volle Audio-Bearbeitungskontrolle
Ein Entwickler hat einen MCP-Server erstellt, der Claude AI mit Audacity verbindet und 99 Werkzeuge für natürliche Sprachbefehle zur Audio-Bearbeitung bereitstellt. Das Open-Source-Tool funktioniert mit Claude Desktop, Claude Code oder Cursor.

Monarch v3: NES-inspiriertes KV-Paging für 78 % schnellere LLM-Inferenz
Monarch v3 implementiert NES-inspiriertes Speicher-Paging für Transformer-Modelle und erreicht 78 % schnellere Inferenz (17,01 auf 30,42 Tok/Sek.) bei einem 1,1B-Parameter-Modell mit nahezu null VRAM-Overhead. Der Open-Source-Algorithmus teilt den KV-Cache in heiße und kalte Bereiche mit Komprimierungs- und Beförderungsmechanismen.

Tangent: Chrome-Erweiterung zum Verzweigen von Claude-Gespraechen
Kostenlose Open-Source-Erweiterung zum Oeffnen von Seitenthreads in Claude ohne den Platz zu verlieren.