Entwickler teilt hybride KI-Codier-Workflow: Claude für die Planung, lokale Modelle für die Ausführung

✍️ OpenClawRadar📅 Veröffentlicht: 16. April 2026🔗 Source
Entwickler teilt hybride KI-Codier-Workflow: Claude für die Planung, lokale Modelle für die Ausführung
Ad

Hybrider KI-Codierungs-Workflow senkt Cloud-Kosten

Ein Entwickler auf r/LocalLLaMA teilte einen detaillierten Workflow, der Cloud- und lokale KI-Modelle kombiniert, um Token-Kosten zu reduzieren und gleichzeitig die Codequalität beizubehalten. Der Ansatz geht auf die Erkenntnis ein, dass viele Codierungsaufgaben keine teuren Cloud-Modelle erfordern.

Die Workflow-Architektur

Das System folgt einer "In der Cloud denken, lokal ausführen"-Logik:

  • Planer (Claude 3.5 Sonnet): Erhält die Aufgabe und generiert eine präzise task_context.md-Datei mit Anweisungen, Dateipfaden und Logik. Dies kostet etwa 300–500 Tokens.
  • Coder (Lokales Qwen2.5-Coder 30B über Ollama): Nimmt die Spezifikation und den tatsächlichen Dateiinhalt, um den Code zu schreiben. Dies läuft lokal ohne Kosten.
  • Validator: Ein einfaches Bash-Skript führt tsc --noEmit oder mypy für die Typüberprüfung aus.
  • Reviewer (Lokales Qwen2.5-Coder 7B): Läuft parallel, um offensichtliche Logikfehler zu prüfen.
  • Auto-fix: Wenn der Build fehlschlägt, geht das Fehlerprotokoll für 2–3 Iterationen zurück an den lokalen Coder.
Ad

Implementierungsdetails

Die gesamte Pipeline ist in eine Reihe von Bash-Skripten eingebettet, die nur jq und curl für die Kommunikation mit der Ollama-API verwenden. Das System erkennt automatisch Sprachstandards (TypeScript, Python, C++ usw.) basierend auf der Ausgabe des Planers und benötigt keine schwergewichtigen Python/Node-Laufzeitumgebungen.

Der Entwickler merkt an, dass lokale Modelle (selbst 30B-Versionen) bei komplexer architektonischer Argumentation oft versagen, aber überraschend gut in der Ausführung sind, wenn sie klare Spezifikationen erhalten.

Ergebnisse und Einsparungen

Bei einem kürzlichen TypeScript-Projekt mit 12 geänderten Dateien:

  • Die Claude-Nutzung war auf die anfängliche Planungsphase beschränkt
  • Lokale Modelle bewältigten alles andere: Schreiben von 12 Dateien, Linting und Review
  • Gesamteinsparung: etwa 85 % Token-Reduktion im Vergleich zur vollständigen Abwicklung innerhalb der Claude Code CLI

Der Entwickler hat die Skripte in einem Repository namens ai-orchestrator auf GitHub (Benutzername: Mybono) für Interessierte an Implementierungsdetails verfügbar gemacht.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Siehe auch

SkillMesh: MCP-freundlicher Router für große Werkzeugkataloge reduziert Kontextgröße um 70 %
Werkzeuge

SkillMesh: MCP-freundlicher Router für große Werkzeugkataloge reduziert Kontextgröße um 70 %

SkillMesh ist ein MCP-freundlicher Router, der für KI-Agenten-Abfragen nur relevante Expertenkarten abruft, die Kontextgröße um 70% reduziert und die Werkzeugauswahl verbessert. Er unterstützt Claude über MCP-Server, Codex-Fähigkeitspakete und OpenAI-ähnliche Funktionsschemata.

OpenClawRadar
Verbesserter Claude-Code-Telegram-Plugin fügt Sprache, Sticker und Threading hinzu
Werkzeuge

Verbesserter Claude-Code-Telegram-Plugin fügt Sprache, Sticker und Threading hinzu

Ein Entwickler hat einen Fork des offiziellen Claude Code Telegram-Plugins veröffentlicht, der Transkription von Sprachnachrichten via Whisper, Sticker/GIF-Unterstützung, Konversations-Threading und Emoji-Reaktionen hinzufügt. Es ist ein Drop-in-Ersatz, der nur Klonen, Kopieren einer Datei und Neustarten erfordert.

OpenClawRadar
Entwickler baut MCP-Server für Claude-WhatsApp-Integration und teilt Herausforderungen
Werkzeuge

Entwickler baut MCP-Server für Claude-WhatsApp-Integration und teilt Herausforderungen

Ein Entwickler hat einen MCP-Server gebaut, um Claude Zugang zu echten WhatsApp-Konversationen zu ermöglichen, und stellte fest, dass die Verwaltung des Konversationskontextes schwieriger als erwartet war und eine Datenbank erforderte, um Konversationen zu verfolgen.

OpenClawRadar
Skillware fügt prompt_rewriter für deterministische Token-Kompression in Claude API-Agenten-Schleifen hinzu
Werkzeuge

Skillware fügt prompt_rewriter für deterministische Token-Kompression in Claude API-Agenten-Schleifen hinzu

Skillware hat eine neue prompt_rewriter-Funktion integriert, die Prompts vor dem Senden an die Claude-API um 50-80% komprimiert, wodurch Kosten in agentenbasierten Schleifen reduziert werden, während das deterministische Komprimieren ein stabiles Verhalten gewährleistet.

OpenClawRadar