Open-Source-Local-Hook schaltet Claude-Modelle automatisch um, um KI-Kosten zu senken

✍️ OpenClawRadar📅 Veröffentlicht: 7. März 2026🔗 Source
Open-Source-Local-Hook schaltet Claude-Modelle automatisch um, um KI-Kosten zu senken
Ad

Ein Entwickler hat einen lokalen Hook quelloffen gemacht, der automatisch das kosteneffizienteste Claude-KI-Modell basierend auf der Art der Programmieraufgabe auswählt, was KI-Kosten um 50-70% reduzieren kann, ohne Qualitätseinbußen.

So funktioniert es

Das Tool läuft als lokaler Hook in Cursor und Claude Code (beide nutzen dasselbe Hook-System) bevor jeder Prompt gesendet wird. Es sitzt neben Opus/Plan und fungiert als effizienter Frontend-Filter, der offensichtlich schlechte Modellzuordnungen verhindert, bevor sie teure Modelle erreichen.

Wesentliche Funktionen

  • Liest den Prompt und die aktuelle Modellauswahl
  • Verwendet einfache Schlüsselwortregeln zur Aufgabenklassifizierung (Git-Operationen, Feature-Arbeit, Architektur/tiefgehende Analyse)
  • Blockiert bei Überzahlung (z.B. Opus für Git-Commit) und schlägt Haiku oder Sonnet vor
  • Blockiert bei Unterdimensionierung (Sonnet/Haiku für Architektur) und schlägt Opus vor
  • Lässt alles andere unverändert durch
  • !-Präfix umgeht den Filter vollständig bei Unstimmigkeiten mit dessen Vorschlag
Ad

Technische Details

  • 3 Dateien: Bash + Python3 + JSON
  • Kein Proxy, keine API-Aufrufe, keine externen Dienste
  • Fail-Open-Design: bei Hängern läuft Claude Code normal weiter
  • Quelloffen verfügbar unter: https://github.com/coyvalyss1/model-matchmaker

Leistung und Tests

Der Entwickler analysierte mehrere Wochen eigener Prompts und fand:

  • 60-70% waren Standard-Feature-Arbeit, die Sonnet bewältigen konnte
  • 5-20% waren Debugging/Fehlerbehebung
  • Ein signifikanter Anteil waren reine Git/Umbenennungs/Formatierungsaufgaben, die Haiku identisch bei 90% geringeren Kosten bewältigt

Retrospektive Analysen zeigten, dass das Tool 50-70% der KI-Ausgaben ohne Qualitätsverlust reduziert hätte. Nach Feinabstimmung bewältigte es 12/12 echte Test-Prompts korrekt.

Gelöstes Problem

Das Problem ist nicht Wissen – Entwickler wissen, dass sie Modelle wechseln sollten – sondern Reibung. Im Flow-Zustand möchten Entwickler nicht über Dropdown-Menüs nachdenken. Dieses Tool automatisiert den Entscheidungsprozess.

📖 Read the full source: r/ClaudeAI

Ad

👀 Siehe auch

MCP Slim: Lokale Embedding-Suche für MCP-Tools reduziert Kontextüberladung
Werkzeuge

MCP Slim: Lokale Embedding-Suche für MCP-Tools reduziert Kontextüberladung

MCP Slim ist ein Proxy, der vollständige MCP-Tool-Kataloge durch drei Meta-Tools (Suche, Beschreibung, Aufruf) ersetzt und dabei lokale MiniLM-Embeddings für semantische Suche nutzt. Er erreicht eine Reduzierung des Kontextfensters um 96 % und funktioniert offline ohne API-Schlüssel.

OpenClawRadar
"Entkrallt: Ein gemeinschaftlich getriebener OpenClaw-Malware-Scanner"
Werkzeuge

"Entkrallt: Ein gemeinschaftlich getriebener OpenClaw-Malware-Scanner"

Declawed ist ein neuer Malware-Scanner für OpenClaw SKILL.md, der sich auf die Erkennung willkürlicher Prompt-Injektionen, bösartiger Inhalte und Informationsdiebstahl in ClawHub-Fähigkeiten konzentriert.

OpenClawRadar
Claude Codes dateibasiertes Speichersystem: Eine pragmatische Alternative zu Vektor-Datenbanken
Werkzeuge

Claude Codes dateibasiertes Speichersystem: Eine pragmatische Alternative zu Vektor-Datenbanken

Claude Code implementiert ein dateibasiertes Speichersystem, das .md-Dateien mit Frontmatter-Metadaten und einer MEMORY.md-Indexdatei verwendet. Es vermeidet Vektordatenbanken und Embedding-Pipelines, indem es Dateien scannt, Manifeste erstellt und ein kleines Modell zur Auswahl relevanter Erinnerungen nutzt.

OpenClawRadar
OpenClaw Lokaler Agent mit TurboQuant-Caching für Mittelklasse-Hardware
Werkzeuge

OpenClaw Lokaler Agent mit TurboQuant-Caching für Mittelklasse-Hardware

Eine One-Click-App für OpenClaw mit lokalen Modellen läuft jetzt auf Mittelklasse-Geräten wie dem MacBook Air mit 16 GB RAM dank TurboQuant-Caching und Kontextvorwärmung. Die Implementierung patcht llama.cpp für zuverlässiges Tool-Calling und erreicht 10-15 Tokens pro Sekunde mit Gemma 4 und QWEN 3.5.

OpenClawRadar