Verwendung eines lokalen LLM als Claude-Code-Subagent zur Reduzierung des Kontextverbrauchs

Claude Code kann Aufgaben orchestrieren, indem es an ein lokales LLM auf Ihrem Rechner delegiert, ähnlich wie es Claude-Subagenten nutzt. Dieser Ansatz hält Dateiinhalte aus Claudes Kontext heraus – nur die Zusammenfassung und Erkenntnisse des lokalen Modells werden zurückgegeben.
So funktioniert es
Ein kleines Python-Skript (etwa 120 Zeilen, nur Standardbibliothek) führt eine Agentenschleife aus:
- Sie übergeben Claude eine Aufgabenbeschreibung ohne Dateiinhalt
- Das Skript sendet sie an den Endpunkt
/v1/chat/completionsvon LM Studio mit den Tool-Definitionenread_fileundlist_dir - Das lokale Modell ruft diese Tools selbst auf, um die benötigten Dateien zu lesen
- Die Schleife läuft weiter, bis sie eine endgültige Antwort erzeugt
- Claude sieht nur das Ergebnis
Beispielbefehl:
python3 agent_lm.py --dir /pfad/zum/projekt "fasse solar-system.html zusammen"
Das führt zu:
- [Runde 1] →
read_file({'path': 'solar-system.html'}) - [Runde 2] → Diese HTML-Datei erstellt ein interaktives animiertes Sonnensystem...
Der Dateiinhalt geht in den Kontext des lokalen Modells (getestet mit Qwens Kontext), nicht in Claudes.
Anwendungsfälle und Einschränkungen
Basierend auf Tests mit Qwen3.5 35B 4-bit über MLX auf Apple Silicon eignet sich dieser Ansatz für:
- Code-Zusammenfassung und Erklärung
- Fehlersuche
- Boilerplate- / Erstentwurf-Generierung
- Texttransformation und -übersetzung (mit Hebräisch getestet)
- Logikaufgaben und Schlussfolgerungen (verwenden Sie das Flag
--thinkfür schwierigere Probleme)
Er eignet sich nicht für:
- Aufgaben, die Claudes vollen Kontext erfordern
- Mehrdateiverständnis, bei dem Beziehungen wichtig sind
- Aufgaben, die den aktuellen Gesprächsverlauf benötigen
- Alles, bei dem Genauigkeit kritisch ist
Betrachten Sie es als einen Haiku-ähnlichen Assistenten, nicht als Ersatz für Claude.
Setup-Anforderungen
- LM Studio läuft lokal mit aktiviertem API-Server
- Ein Python-Skript für die Agentenschleife, eines für einfache Nur-Prompt-Abfragen
- Beide in eine globale
~/.claude/CLAUDE.mdeingebunden, damit Claude Code weiß, wann Delegation angeboten werden soll - Kein MCP-Server, keine pip-Abhängigkeiten, keine Plugin-Infrastruktur erforderlich
Konfigurationstipp: Fügen Sie {%- set enable_thinking = false %} an den Anfang der Jinja-Vorlage hinzu. Für die meisten Aufgaben muss das lokale Modell nicht schlussfolgern, und das spart Zeit und Tokens, während die Geschwindigkeit ohne echte Qualitätseinbußen für solche Aufgaben steigt.
📖 Read the full source: r/ClaudeAI
👀 Siehe auch

RalphBegriff: Ralph-artige Schleife für Claude Code mit gegenseitigen Überprüfungssitzungen verschiedener Agenten
RalphTerm ist ein Open-Source-Rust-CLI, der eine ralph-artige äußere Schleife um Claude Code herum ausführt: Er nimmt einen Markdown-Plan, führt Aufgaben in frischen interaktiven Sitzungen aus und führt eine Kreuzüberprüfung mit einem anderen Modell (z. B. Codex) in separaten frischen Sitzungen durch, wobei Probleme zurück an neue Implementierungssitzungen gemeldet werden.

Sokratischer Prompt-Generator, erstellt als React-Artefakt in Claude
Ein Entwickler hat einen sokratischen Prompt-Generator als React-Artefakt erstellt, der innerhalb von Claude läuft und automatisch die Eingabekomplexität erkennt sowie eine dreistufige Prompt-Generierung mit Fehlermodusanalyse bietet.

Atlarix v5.1 fügt Cloud-Tiering hinzu, während die lokale KI-Codeunterstützung erhalten bleibt.
Atlarix v5.1.0 führt Compass-Cloud-Tarife für den sofortigen Einsatz ein und behält dabei die volle Unterstützung für Ollama und LM Studio bei. Die IDE verwendet einen persistenten SQLite-Graphen namens Blueprint, um lokalen Modellen präzisen Kontext zu liefern.

Rukuzu: Portierung einer 200.000 Zeilen umfassenden C++-Graphdatenbank zu Rust mit systematischem Testen
Das Rukuzu-Projekt beschreibt einen Workflow für die Portierung der 200.000 Zeilen umfassenden C++-kuzu-Embedded-Graphdatenbank zu Rust, wobei ein Claude Code Custom Command verwendet wird, um beide Versionen gleichzeitig zu pflegen und die Korrektheit durch über 2.700 Tests zu überprüfen.