Jeden MCP-Server bei jeder Eingabeaufforderung zu laden, zerstört leise das Token-Budget

Ein Beitrag auf r/ClaudeAI berichtet von einem subtilen, aber kostspieligen Problem: Wenn mehrere MCP-Server konfiguriert sind, lädt jeder Prompt standardmäßig alle von ihnen, selbst bei trivialen Anfragen. Der Benutzer hatte 5–6 Server und bemerkte es erst, als er die Token-Nutzung überprüfte – Prompts verbrannten jedes Mal Token für das Laden irrelevanter Serverdefinitionen.
Wichtige Details
- Jeder Prompt lud den vollständigen Satz an MCP-Servern (5–6 Server).
- Selbst einfache Prompts (z.B. „Wie spät ist es?") lösten alle Serverdefinitionen aus.
- Lösung: eine benutzerdefinierte Routing-Schicht, die nur die für den Prompt relevanten Server auswählt.
- Ergebnis: Der Token-Verbrauch sank erheblich, und die Antwortzeiten der Prompts verbesserten sich.
- Der OP gab zu: „Ich kann nicht glauben, dass ich das so lange laufen ließ, ohne es zu überprüfen."
Technischer Kontext
MCP (Model Context Protocol) Server sind Werkzeuge, die Claudias Fähigkeiten erweitern (z.B. Dateisystemzugriff, Datenbankabfragen, Web Scraping). Das Standardverhalten in vielen Setups – einschließlich geforkter Clients und manueller Konfigurationen – besteht darin, die gesamte Liste der Serverdefinitionen mit jeder Nachricht zu senden. Das bedeutet, dass Werkzeuge für DB-Zugriff, Datei-I/O, Webbrowsing usw. alle in den Kontextfenster geladen werden, bevor die eigentliche Benutzereingabe verarbeitet wird.
Eine Routing-Schicht kann die Nachricht des Benutzers (oder den System-Prompt) überprüfen und nur die MCP-Server bedingt einbeziehen, deren Beschreibungen oder Werkzeuge zur Absicht passen. Beispielsweise würde ein Prompt, der einen Dateipfad erwähnt, Dateiwerkzeuge aktivieren; eine Frage zu Aktienkursen würde nur den Finanzserver laden. Dies vermeidet den Token-Overhead irrelevanter Server-Metadaten.
Für wen das relevant ist
Entwickler, die Claude mit mehreren MCP-Servern betreiben, insbesondere in automatisierten Pipelines oder benutzerdefinierten Frontends, bei denen Token-Effizienz zählt.
📖 Vollständige Quelle lesen: r/ClaudeAI
👀 Siehe auch

Reddit-Benutzer teilt Prompt-Struktur, um Code-Ausgabe-Drift von Claude bei komplexen Aufgaben zu reduzieren
Ein Reddit-Nutzer fand heraus, dass die Verwendung einer strukturierten Prompt-Anordnung für längere Claude Code-Aufgaben hilft, Output-Drift zu verhindern. Der Ansatz beinhaltet die Definition spezifischer Elemente wie Aufgabenumfang, benötigte Dateien, Erfolgskriterien und Vermeidungsparameter vor der Ausführung.

Claude-Nutzer berichten von schnelleren Sitzungen, indem sie Markdown anstelle von Word-Dokumenten anfordern.
Ein Claude-Benutzer entdeckte, dass die Anfrage nach Markdown statt Word-Dokumenten die Antwortzeit und den Token-Verbrauch erheblich reduziert. Die KI gibt von Natur aus Markdown aus, während die Erstellung von .docx-Dateien das Starten einer Python-Umgebung und das Ausführen von Konvertierungsskripten erfordert.

Acht Prompting-Techniken, die die Ausgabequalität von Claude verbessern
Ein Reddit-Nutzer teilt acht spezifische Prompting-Techniken, die die Qualität seiner Claude-Ausgaben durchgängig verbessert haben, darunter Befehle wie „Denke vor der Antwort jede Ebene durch“ und „Finde die 20 % der Aktionen, die 80 % der Ergebnisse bewirken“.

OpenClaw-Absturzschleife-Debugging: Eine 5-Punkte-Checkliste
Ein Reddit-Beitrag aus r/openclaw bietet eine fünfstufige Checkliste zur schnellen Diagnose von Absturzschleifen in OpenClaw-Agenten oder Gateways, die sich auf Fehlerform, Host-Auslastung, Provider-Latenz, Konfigurationsunterschiede und Alarmierung konzentriert.