Prefex: Ein lokaler Proxy für Claude-Code, der Prompt-Caching und Sitzungsspeicherung automatisiert

Prefex ist ein lokales Proxy-Tool, das entwickelt wurde, um API-Kosten bei der Nutzung von Claude Code zu senken. Es behebt zwei spezifische Kosteneffizienzprobleme: Die Beta-Prompt-Caching-Funktion von Anthropic erfordert manuelle Header-Einfügung, und Claude Code sendet bei jeder Anfrage den gesamten Konversationsverlauf.
Wie es funktioniert
Prefex läuft vollständig auf Ihrem lokalen Rechner als Proxy zwischen Claude Code und der API von Anthropic. Es fügt automatisch den spezifischen Header ein, der benötigt wird, um die Prompt-Caching-Funktion von Anthropic zu aktivieren, wodurch die Kosten für wiederholte Eingabetokens um 90 % reduziert werden. Ohne diesen Header werden alle Anfragen, einschließlich Ihrer CLAUDE.md und des Projektkontexts, zum vollen Preis abgerechnet.
Das Tool implementiert auch Sitzungsspeicher, der verhindert, dass Claude Code bei jeder Runde den gesamten Konversationsverlauf erneut sendet. Zusätzlich enthält es einen Modell-Router, der einfachere Anfragen an günstigere Modelle weiterleiten kann, obwohl diese Funktion während der anfänglichen Testphase nicht aktiv war.
Leistung und Installation
In einem 4-tägigen Test mit normaler Nutzung:
- 1.338 Anfragen verarbeitet
- 49,60 $ tatsächliche Kosten mit Prefex
- 348 $ geschätzte Kosten ohne Prefex
- 86 % Einsparungen erzielt (nur mit Caching, ohne Modell-Routing)
Der Entwickler stellt einen Benchmark zur Verfügung, der 5 Fragen zu karpathy/nanoGPT mit kalten und warmen Starts ausführt und etwa 0,03 $ kostet. Die Kostenberechnungen verwenden die tatsächlichen Abrechnungsfelder von Anthropic.
Die Installation erfordert einen curl-Befehl und das Hinzufügen einer Zeile zu settings.json. Das Paket enthält ein Deinstallationsskript. Das Tool arbeitet lokal ohne externe Server, ohne Telemetrie, und API-Schlüssel gehen direkt an Anthropic.
📖 Read the full source: r/ClaudeAI
👀 Siehe auch

Agent Times Skill für ClawHub fügt Echtzeit-Nachrichten, Wetter- und Token-Preisabfragen hinzu
Eine neue ClawHub-Fähigkeit namens Agent Times ermöglicht es KI-Agenten, Echtzeit-Anfragen zu Nachrichten, Wetter und Kryptowährungspreisen zu beantworten. Die Installation erfolgt über npx clawhub install agenttimes, und sie bietet Zugriff auf über 228.000 Artikel aus 3.576 Feeds mit Stimmungsbewertung und Entitätsextraktion.

soul.py fügt lokalen LLMs mit einem einfachen dateibasierten Ansatz persistente Speicherung hinzu
soul.py ist eine Python-Bibliothek, die persistente Speicherung für beliebige LLMs hinzufügt, indem sie zwei Markdown-Dateien für Identität und Konversationsprotokollierung verwendet. Sie funktioniert mit Ollama-, OpenAI- und Anthropic-Modellen, ohne Datenbanken oder Server zu benötigen.

Open-Source-Claude-Code-Fähigkeit /unzuck kuratiert Social-Media-Feeds in Dashboards
Eine kostenlose, quelloffene Claude Code-Fähigkeit namens /unzuck scannt parallel Feeds von Hacker News, Reddit, LinkedIn, YouTube, Twitter/X, Instagram und Facebook mithilfe von Browser-Automatisierung, bewertet Beiträge anhand von Nutzerinteressenprofilen und erstellt interaktive HTML-Dashboards.

Claude Code wurde verwendet, um über 4.000 Blind-Werewolf-Spiele mit LLMs zu simulieren
Ein Entwickler nutzte Claude Code, um einen Simulator zu erstellen, in dem LLMs blindes Ein-Nacht-Werwolf spielen, mit etwa 4.600 Spielen über OpenAI- und xAI-Modelle hinweg. Das Experiment zeigte konsistente namensbasierte Abstimmungsmuster trotz minimaler Spielsignale.