Claude Code überträgt Codierung an Mistral/DeepSeek: 57M Tokens eingespart, 90-100 % Kostenreduktion

Der Entwickler pcx_wave veröffentlichte eine detaillierte Analyse von vibe-skill, einer Claude Code-Funktion, die Programmieraufgaben an günstigere Modelle (Mistral oder DeepSeek) delegiert, während Claude für die Planung und Überprüfung zuständig ist. Nach 10 Tagen und 254 Ausführungen wurden 57 Millionen Tokens eingespart und die Kosten um 90-100% gesenkt, bei gleichbleibender Claude-Qualität der Ergebnisse.
Wie es funktioniert
Vibe-skill läuft innerhalb von Claude Code. Du tippst /vibeon <was auch immer>, Claude zerlegt die Aufgabe und delegiert die eigentliche Codierung an ein leichtgewichtiges Modell (über das Open-Source-Tool Vibe). Anschließend überprüft Claude den Diff und korrigiert Fehler. Das günstige Modell verbraucht die Tokens; Claude gibt nur Tokens für Planung und Überprüfung aus.
Ergebnisse nach Modell
| Modell | Delegierte Tokens | Tatsächliche Kosten | Claude-Äquivalent | Einsparung |
|---|---|---|---|---|
| DeepSeek V4 Flash | 29M | 4,13 $ | 92,16 $ | 95% |
| Mistral Medium 3.5 | 28M | 0 $ (Pro-Abo) | 84,77 $ | 100% |
Gesamterfolgsquote: 98% bei 254 Ausführungen. Wenn die Delegierung fehlschlägt, erkennt und korrigiert Claude die Ausgabe.
Token-Ökonomie
Mistral-Tokens sind etwa 50% günstiger als die von Claude; DeepSeek-Tokens sind 95% günstiger. Der Autor nutzt ein Mistral Pro-Abo (18,36 $/Monat), das etwa 1 Milliarde kostenlose Tokens enthält. Für Mistral Pro-Abonnenten kostet die Delegierung 0 $, bis das Kontingent erschöpft ist; danach wird automatisch auf DeepSeek zurückgegriffen (da Mistral PAYG mit 1,52 $/M Tokens 10× teurer ist als DeepSeek).
Der Break-even-Punkt: DeepSeek allein ist günstiger als das Mistral Pro-Abo, wenn du weniger als 131M Tokens/Monat delegierst (18,36 $ / 0,14 $ pro M). Oberhalb dieses Volumens gewinnt Mistral Pro mit etwa 10× mehr Spielraum, bevor das Kontingent erreicht wird.
Einrichtung
Die Funktion ist Open Source unter github.com/pcx-wave/vibe-skill. Eine ähnliche Gemini-Funktion ist ebenfalls verfügbar, aber weniger konfigurierbar und instabil. Um sie zu nutzen, klone das Repository und lade die Funktion in Claude Code — dann einfach /vibeon für deine Aufgabe.
📖 Vollständige Quelle lesen: r/ClaudeAI
👀 Siehe auch

Qwen 3.5 Chat Template Release mit 21 Fehlerbehebungen für Agenten-Workflows
Ein Entwickler hat eine korrigierte Chat-Vorlage für Qwen-3.5-Modelle veröffentlicht, die 21 Fehler behebt, darunter Abstürze bei Tool-Aufrufen, Trennung paralleler Aufrufe und Stabilität von Agenten-Schleifen. Es handelt sich um einen direkten Ersatz, der auf llama.cpp, Open WebUI, vLLM und anderen Plattformen getestet wurde.

JANG-Quantisierungsmethode verbessert MLX-Leistung für große Modelle
Eine neue Quantisierungsmethode namens JANG ermöglicht das Ausführen großer Modelle wie MiniMax-M2.5 und Qwen 3.5 auf Apples MLX-Framework mit deutlich besserer Leistung als die Standard-MLX-Quantisierung. Sie erreicht nahezu native Geschwindigkeiten bei einer Genauigkeit, die mit höherbitigen Quantisierungen vergleichbar ist.

Brücke Claude-Code zu Chat-Apps für Ferninteraktion
Ein GitHub-Projekt namens cc-connect verbindet Claude Code mit Messaging-Plattformen wie Slack und Telegram und ermöglicht so eine Remote-Interaktion, ohne Ihren lokalen Rechner freizulegen. Der Agent läuft lokal, während eine kleine Brücke Nachrichten zwischen dem Agent und den Chat-Apps weiterleitet.

Drei Repositories für RAG und KI-Agenten-Entwicklung
Ein Reddit-Beitrag hebt drei Repositories für Entwickler hervor, die mit RAG und KI-Agenten arbeiten: memvid für Agentenspeicher, llama_index für RAG-Pipelines und Continue für Programmierassistenten. Der Autor merkt an, dass reine RAG für Wissensabfragen am besten funktioniert, während Speichersysteme besser für Agenten geeignet sind, wobei hybride Ansätze in realen Tools üblich sind.