Claude Code überträgt Codierung an Mistral/DeepSeek: 57M Tokens eingespart, 90-100 % Kostenreduktion

✍️ OpenClawRadar📅 Veröffentlicht: 27. Mai 2026🔗 Source
Claude Code überträgt Codierung an Mistral/DeepSeek: 57M Tokens eingespart, 90-100 % Kostenreduktion
Ad

Der Entwickler pcx_wave veröffentlichte eine detaillierte Analyse von vibe-skill, einer Claude Code-Funktion, die Programmieraufgaben an günstigere Modelle (Mistral oder DeepSeek) delegiert, während Claude für die Planung und Überprüfung zuständig ist. Nach 10 Tagen und 254 Ausführungen wurden 57 Millionen Tokens eingespart und die Kosten um 90-100% gesenkt, bei gleichbleibender Claude-Qualität der Ergebnisse.

Wie es funktioniert

Vibe-skill läuft innerhalb von Claude Code. Du tippst /vibeon <was auch immer>, Claude zerlegt die Aufgabe und delegiert die eigentliche Codierung an ein leichtgewichtiges Modell (über das Open-Source-Tool Vibe). Anschließend überprüft Claude den Diff und korrigiert Fehler. Das günstige Modell verbraucht die Tokens; Claude gibt nur Tokens für Planung und Überprüfung aus.

Ergebnisse nach Modell

ModellDelegierte TokensTatsächliche KostenClaude-ÄquivalentEinsparung
DeepSeek V4 Flash29M4,13 $92,16 $95%
Mistral Medium 3.528M0 $ (Pro-Abo)84,77 $100%

Gesamterfolgsquote: 98% bei 254 Ausführungen. Wenn die Delegierung fehlschlägt, erkennt und korrigiert Claude die Ausgabe.

Ad

Token-Ökonomie

Mistral-Tokens sind etwa 50% günstiger als die von Claude; DeepSeek-Tokens sind 95% günstiger. Der Autor nutzt ein Mistral Pro-Abo (18,36 $/Monat), das etwa 1 Milliarde kostenlose Tokens enthält. Für Mistral Pro-Abonnenten kostet die Delegierung 0 $, bis das Kontingent erschöpft ist; danach wird automatisch auf DeepSeek zurückgegriffen (da Mistral PAYG mit 1,52 $/M Tokens 10× teurer ist als DeepSeek).

Der Break-even-Punkt: DeepSeek allein ist günstiger als das Mistral Pro-Abo, wenn du weniger als 131M Tokens/Monat delegierst (18,36 $ / 0,14 $ pro M). Oberhalb dieses Volumens gewinnt Mistral Pro mit etwa 10× mehr Spielraum, bevor das Kontingent erreicht wird.

Einrichtung

Die Funktion ist Open Source unter github.com/pcx-wave/vibe-skill. Eine ähnliche Gemini-Funktion ist ebenfalls verfügbar, aber weniger konfigurierbar und instabil. Um sie zu nutzen, klone das Repository und lade die Funktion in Claude Code — dann einfach /vibeon für deine Aufgabe.

📖 Vollständige Quelle lesen: r/ClaudeAI

Ad

👀 Siehe auch

Qwen 3.5 Chat Template Release mit 21 Fehlerbehebungen für Agenten-Workflows
Werkzeuge

Qwen 3.5 Chat Template Release mit 21 Fehlerbehebungen für Agenten-Workflows

Ein Entwickler hat eine korrigierte Chat-Vorlage für Qwen-3.5-Modelle veröffentlicht, die 21 Fehler behebt, darunter Abstürze bei Tool-Aufrufen, Trennung paralleler Aufrufe und Stabilität von Agenten-Schleifen. Es handelt sich um einen direkten Ersatz, der auf llama.cpp, Open WebUI, vLLM und anderen Plattformen getestet wurde.

OpenClawRadar
JANG-Quantisierungsmethode verbessert MLX-Leistung für große Modelle
Werkzeuge

JANG-Quantisierungsmethode verbessert MLX-Leistung für große Modelle

Eine neue Quantisierungsmethode namens JANG ermöglicht das Ausführen großer Modelle wie MiniMax-M2.5 und Qwen 3.5 auf Apples MLX-Framework mit deutlich besserer Leistung als die Standard-MLX-Quantisierung. Sie erreicht nahezu native Geschwindigkeiten bei einer Genauigkeit, die mit höherbitigen Quantisierungen vergleichbar ist.

OpenClawRadar
Brücke Claude-Code zu Chat-Apps für Ferninteraktion
Werkzeuge

Brücke Claude-Code zu Chat-Apps für Ferninteraktion

Ein GitHub-Projekt namens cc-connect verbindet Claude Code mit Messaging-Plattformen wie Slack und Telegram und ermöglicht so eine Remote-Interaktion, ohne Ihren lokalen Rechner freizulegen. Der Agent läuft lokal, während eine kleine Brücke Nachrichten zwischen dem Agent und den Chat-Apps weiterleitet.

OpenClawRadar
Drei Repositories für RAG und KI-Agenten-Entwicklung
Werkzeuge

Drei Repositories für RAG und KI-Agenten-Entwicklung

Ein Reddit-Beitrag hebt drei Repositories für Entwickler hervor, die mit RAG und KI-Agenten arbeiten: memvid für Agentenspeicher, llama_index für RAG-Pipelines und Continue für Programmierassistenten. Der Autor merkt an, dass reine RAG für Wissensabfragen am besten funktioniert, während Speichersysteme besser für Agenten geeignet sind, wobei hybride Ansätze in realen Tools üblich sind.

OpenClawRadar