Open-Source-Local-Hook schaltet Claude-Modelle automatisch um, um KI-Kosten zu senken

Ein Entwickler hat einen lokalen Hook quelloffen gemacht, der automatisch das kosteneffizienteste Claude-KI-Modell basierend auf der Art der Programmieraufgabe auswählt, was KI-Kosten um 50-70% reduzieren kann, ohne Qualitätseinbußen.
So funktioniert es
Das Tool läuft als lokaler Hook in Cursor und Claude Code (beide nutzen dasselbe Hook-System) bevor jeder Prompt gesendet wird. Es sitzt neben Opus/Plan und fungiert als effizienter Frontend-Filter, der offensichtlich schlechte Modellzuordnungen verhindert, bevor sie teure Modelle erreichen.
Wesentliche Funktionen
- Liest den Prompt und die aktuelle Modellauswahl
- Verwendet einfache Schlüsselwortregeln zur Aufgabenklassifizierung (Git-Operationen, Feature-Arbeit, Architektur/tiefgehende Analyse)
- Blockiert bei Überzahlung (z.B. Opus für Git-Commit) und schlägt Haiku oder Sonnet vor
- Blockiert bei Unterdimensionierung (Sonnet/Haiku für Architektur) und schlägt Opus vor
- Lässt alles andere unverändert durch
- !-Präfix umgeht den Filter vollständig bei Unstimmigkeiten mit dessen Vorschlag
Technische Details
- 3 Dateien: Bash + Python3 + JSON
- Kein Proxy, keine API-Aufrufe, keine externen Dienste
- Fail-Open-Design: bei Hängern läuft Claude Code normal weiter
- Quelloffen verfügbar unter: https://github.com/coyvalyss1/model-matchmaker
Leistung und Tests
Der Entwickler analysierte mehrere Wochen eigener Prompts und fand:
- 60-70% waren Standard-Feature-Arbeit, die Sonnet bewältigen konnte
- 5-20% waren Debugging/Fehlerbehebung
- Ein signifikanter Anteil waren reine Git/Umbenennungs/Formatierungsaufgaben, die Haiku identisch bei 90% geringeren Kosten bewältigt
Retrospektive Analysen zeigten, dass das Tool 50-70% der KI-Ausgaben ohne Qualitätsverlust reduziert hätte. Nach Feinabstimmung bewältigte es 12/12 echte Test-Prompts korrekt.
Gelöstes Problem
Das Problem ist nicht Wissen – Entwickler wissen, dass sie Modelle wechseln sollten – sondern Reibung. Im Flow-Zustand möchten Entwickler nicht über Dropdown-Menüs nachdenken. Dieses Tool automatisiert den Entscheidungsprozess.
📖 Read the full source: r/ClaudeAI
👀 Siehe auch

MCP Slim: Lokale Embedding-Suche für MCP-Tools reduziert Kontextüberladung
MCP Slim ist ein Proxy, der vollständige MCP-Tool-Kataloge durch drei Meta-Tools (Suche, Beschreibung, Aufruf) ersetzt und dabei lokale MiniLM-Embeddings für semantische Suche nutzt. Er erreicht eine Reduzierung des Kontextfensters um 96 % und funktioniert offline ohne API-Schlüssel.

"Entkrallt: Ein gemeinschaftlich getriebener OpenClaw-Malware-Scanner"
Declawed ist ein neuer Malware-Scanner für OpenClaw SKILL.md, der sich auf die Erkennung willkürlicher Prompt-Injektionen, bösartiger Inhalte und Informationsdiebstahl in ClawHub-Fähigkeiten konzentriert.

Claude Codes dateibasiertes Speichersystem: Eine pragmatische Alternative zu Vektor-Datenbanken
Claude Code implementiert ein dateibasiertes Speichersystem, das .md-Dateien mit Frontmatter-Metadaten und einer MEMORY.md-Indexdatei verwendet. Es vermeidet Vektordatenbanken und Embedding-Pipelines, indem es Dateien scannt, Manifeste erstellt und ein kleines Modell zur Auswahl relevanter Erinnerungen nutzt.

OpenClaw Lokaler Agent mit TurboQuant-Caching für Mittelklasse-Hardware
Eine One-Click-App für OpenClaw mit lokalen Modellen läuft jetzt auf Mittelklasse-Geräten wie dem MacBook Air mit 16 GB RAM dank TurboQuant-Caching und Kontextvorwärmung. Die Implementierung patcht llama.cpp für zuverlässiges Tool-Calling und erreicht 10-15 Tokens pro Sekunde mit Gemma 4 und QWEN 3.5.