Parallel-Sub-Agenten in Claude Code: Wann sie Tokens sparen vs. verbrennen

Anthropic-Zahlen, die im Hype um „Unter-Agenten!“ oft ignoriert werden: Multi-Agent-Systeme verbrauchen etwa 15× mehr Tokens als ein einzelner Chat, und sie sind „weniger effektiv für eng miteinander verbundene Aufgaben wie Programmieren“ (Quelle). Jedoch kosten gecachte Tokens nur 10 % des Normalpreises (90 % Rabatt) – aber nur, wenn der Inhalt, der für das Caching markiert wurde, über mehrere Anfragen hinweg identisch ist (Quelle).
Multi-Agent vervielfacht den Tokenverbrauch um 15. Der Cache teilt ihn durch 10. Ob Unter-Agenten sparen oder verbrennen, läuft auf eine Sache hinaus: Haben alle Unter-Agenten dasselbe Präfix?
Drei Möglichkeiten zu delegieren, geordnet nach Kosten
- 1. Unter-Agent mit gesetztem
subagent_type. Eigenes System-Prompt, eigene Tools, eigene Berechtigungen (Anthropic). Unterschiedliches Prompt = unterschiedlicher Cache. Kein Teilen mit dem Eltern-Agent. Vollpreis bei jedem Start. Verwenden, wenn Isolation wirklich nötig ist. - 2. Klon, der vom Eltern-Agent erbt. Kein
subagent_type. Erbt das Prompt, die Tools und den Verlauf des Eltern-Agent exakt. Kinder 2..N treffen den Cache zu 10 % Preis. Fünf Klone, die parallel Dateien lesen ≈ 5× Geschwindigkeit bei ~1,5× Kosten. - 3. Kein Unter-Agent. Im Haupt-Agent bleiben. Am günstigsten pro Schritt. Die richtige Antwort, wenn die Arbeit von sich selbst abhängt – Refactorings, bei denen Schritt 2 das Ergebnis von Schritt 1 benötigt.
Wann NICHT delegieren (Anthropics eigene Richtlinie)
„Am besten geeignet für Aufgaben, die in parallele Recherchestränge aufgeteilt werden können.“ Übersetzung:
- Gut: 7 Dateien parallel lesen, Ordner auf ein Muster prüfen, Informationen aus vielen Quellen sammeln.
- Schlecht: Ein Modul umgestalten, einen Fehler beheben, bei dem jeder Schritt vom vorherigen abhängt. Nur Haupt-Agent.
Wenn man eng gekoppelte Arbeit in Unter-Agenten aufteilt, zahlt man 15× und gewinnt nichts.
Was den Cache zerstört
Anthropic: Das Bearbeiten von Tooldefinitionen, das Wechseln von Modellen, das Hinzufügen oder Entfernen von Bildern oder das Ändern der früheren Prompt-Struktur zerstört das gecachte Präfix (Quelle). Also:
- Installiere deine MCPs zu Sitzungsbeginn, nicht während der Sitzung.
- Wähle das Modell vorab aus.
- Bearbeite
CLAUDE.mdoder Auto-Memory nicht während der Sitzung – sie leben im gecachten Präfix.
📖 Vollständige Quelle lesen: r/ClaudeAI
👀 Siehe auch

CopilotKit: Open-Source React-Bausteine für Agenten-Benutzeroberflächen
CopilotKit (30k Stars, MIT) bietet React-Komponenten für die Agenten-UI-Ebene: Chat, Streaming, Tool-Aufrufe, Human-in-the-Loop und generative UI, mit Unterstützung des AG-UI-Protokolls über LangGraph, ADK, CrewAI und mehr.

Jan-Code-4B: Ein schlankes, code-optimiertes Modell für die lokale Entwicklung
Das Jan-Team veröffentlichte Jan-Code-4B, ein 4B-Parameter-Modell für Code, das auf Jan-v3-4B-base-instruct basiert. Es ist als direkter Ersatz für Haiku in Claude Code konzipiert und bietet verbesserte Unterstützung beim Programmieren, während es lokal läuft.

Flash-MoE: Ausführen eines 397B-Parameter-Qwen-Modells auf dem MacBook Pro mit reinem C/Metal
Flash-MoE ist eine reine C/Metal-Inferenz-Engine, die das 397-Milliarden-Parameter-Mixture-of-Experts-Modell Qwen3.5-397B-A17B auf einem MacBook Pro mit 48 GB RAM mit 4,4+ Token/Sekunde ausführt. Das 209 GB große Modell wird über benutzerdefinierte Metal-Compute-Shader direkt von der SSD gestreamt, ohne Python oder Frameworks.

QCAI Mobile App fügt OpenClaw-Gateway-Steuerung mit nativer Tailscale-VPN-Unterstützung hinzu
QCAI für iOS und Android integriert nun OpenClaw Control Center, ermöglicht direkte Gateway-Verwaltung von Mobilgeräten über sichere Tailscale-VPN-Tunnel ohne offene Ports.