Entwickler teilt hybride KI-Codier-Workflow: Claude für die Planung, lokale Modelle für die Ausführung

Hybrider KI-Codierungs-Workflow senkt Cloud-Kosten
Ein Entwickler auf r/LocalLLaMA teilte einen detaillierten Workflow, der Cloud- und lokale KI-Modelle kombiniert, um Token-Kosten zu reduzieren und gleichzeitig die Codequalität beizubehalten. Der Ansatz geht auf die Erkenntnis ein, dass viele Codierungsaufgaben keine teuren Cloud-Modelle erfordern.
Die Workflow-Architektur
Das System folgt einer "In der Cloud denken, lokal ausführen"-Logik:
- Planer (Claude 3.5 Sonnet): Erhält die Aufgabe und generiert eine präzise
task_context.md-Datei mit Anweisungen, Dateipfaden und Logik. Dies kostet etwa 300–500 Tokens. - Coder (Lokales Qwen2.5-Coder 30B über Ollama): Nimmt die Spezifikation und den tatsächlichen Dateiinhalt, um den Code zu schreiben. Dies läuft lokal ohne Kosten.
- Validator: Ein einfaches Bash-Skript führt
tsc --noEmitodermypyfür die Typüberprüfung aus. - Reviewer (Lokales Qwen2.5-Coder 7B): Läuft parallel, um offensichtliche Logikfehler zu prüfen.
- Auto-fix: Wenn der Build fehlschlägt, geht das Fehlerprotokoll für 2–3 Iterationen zurück an den lokalen Coder.
Implementierungsdetails
Die gesamte Pipeline ist in eine Reihe von Bash-Skripten eingebettet, die nur jq und curl für die Kommunikation mit der Ollama-API verwenden. Das System erkennt automatisch Sprachstandards (TypeScript, Python, C++ usw.) basierend auf der Ausgabe des Planers und benötigt keine schwergewichtigen Python/Node-Laufzeitumgebungen.
Der Entwickler merkt an, dass lokale Modelle (selbst 30B-Versionen) bei komplexer architektonischer Argumentation oft versagen, aber überraschend gut in der Ausführung sind, wenn sie klare Spezifikationen erhalten.
Ergebnisse und Einsparungen
Bei einem kürzlichen TypeScript-Projekt mit 12 geänderten Dateien:
- Die Claude-Nutzung war auf die anfängliche Planungsphase beschränkt
- Lokale Modelle bewältigten alles andere: Schreiben von 12 Dateien, Linting und Review
- Gesamteinsparung: etwa 85 % Token-Reduktion im Vergleich zur vollständigen Abwicklung innerhalb der Claude Code CLI
Der Entwickler hat die Skripte in einem Repository namens ai-orchestrator auf GitHub (Benutzername: Mybono) für Interessierte an Implementierungsdetails verfügbar gemacht.
📖 Read the full source: r/LocalLLaMA
👀 Siehe auch

SkillMesh: MCP-freundlicher Router für große Werkzeugkataloge reduziert Kontextgröße um 70 %
SkillMesh ist ein MCP-freundlicher Router, der für KI-Agenten-Abfragen nur relevante Expertenkarten abruft, die Kontextgröße um 70% reduziert und die Werkzeugauswahl verbessert. Er unterstützt Claude über MCP-Server, Codex-Fähigkeitspakete und OpenAI-ähnliche Funktionsschemata.

Verbesserter Claude-Code-Telegram-Plugin fügt Sprache, Sticker und Threading hinzu
Ein Entwickler hat einen Fork des offiziellen Claude Code Telegram-Plugins veröffentlicht, der Transkription von Sprachnachrichten via Whisper, Sticker/GIF-Unterstützung, Konversations-Threading und Emoji-Reaktionen hinzufügt. Es ist ein Drop-in-Ersatz, der nur Klonen, Kopieren einer Datei und Neustarten erfordert.

Entwickler baut MCP-Server für Claude-WhatsApp-Integration und teilt Herausforderungen
Ein Entwickler hat einen MCP-Server gebaut, um Claude Zugang zu echten WhatsApp-Konversationen zu ermöglichen, und stellte fest, dass die Verwaltung des Konversationskontextes schwieriger als erwartet war und eine Datenbank erforderte, um Konversationen zu verfolgen.

Skillware fügt prompt_rewriter für deterministische Token-Kompression in Claude API-Agenten-Schleifen hinzu
Skillware hat eine neue prompt_rewriter-Funktion integriert, die Prompts vor dem Senden an die Claude-API um 50-80% komprimiert, wodurch Kosten in agentenbasierten Schleifen reduziert werden, während das deterministische Komprimieren ein stabiles Verhalten gewährleistet.