Jeden MCP-Server bei jeder Eingabeaufforderung zu laden, zerstört leise das Token-Budget

✍️ OpenClawRadar📅 Veröffentlicht: 2. Mai 2026🔗 Source
Jeden MCP-Server bei jeder Eingabeaufforderung zu laden, zerstört leise das Token-Budget
Ad

Ein Beitrag auf r/ClaudeAI berichtet von einem subtilen, aber kostspieligen Problem: Wenn mehrere MCP-Server konfiguriert sind, lädt jeder Prompt standardmäßig alle von ihnen, selbst bei trivialen Anfragen. Der Benutzer hatte 5–6 Server und bemerkte es erst, als er die Token-Nutzung überprüfte – Prompts verbrannten jedes Mal Token für das Laden irrelevanter Serverdefinitionen.

Wichtige Details

  • Jeder Prompt lud den vollständigen Satz an MCP-Servern (5–6 Server).
  • Selbst einfache Prompts (z.B. „Wie spät ist es?") lösten alle Serverdefinitionen aus.
  • Lösung: eine benutzerdefinierte Routing-Schicht, die nur die für den Prompt relevanten Server auswählt.
  • Ergebnis: Der Token-Verbrauch sank erheblich, und die Antwortzeiten der Prompts verbesserten sich.
  • Der OP gab zu: „Ich kann nicht glauben, dass ich das so lange laufen ließ, ohne es zu überprüfen."
Ad

Technischer Kontext

MCP (Model Context Protocol) Server sind Werkzeuge, die Claudias Fähigkeiten erweitern (z.B. Dateisystemzugriff, Datenbankabfragen, Web Scraping). Das Standardverhalten in vielen Setups – einschließlich geforkter Clients und manueller Konfigurationen – besteht darin, die gesamte Liste der Serverdefinitionen mit jeder Nachricht zu senden. Das bedeutet, dass Werkzeuge für DB-Zugriff, Datei-I/O, Webbrowsing usw. alle in den Kontextfenster geladen werden, bevor die eigentliche Benutzereingabe verarbeitet wird.

Eine Routing-Schicht kann die Nachricht des Benutzers (oder den System-Prompt) überprüfen und nur die MCP-Server bedingt einbeziehen, deren Beschreibungen oder Werkzeuge zur Absicht passen. Beispielsweise würde ein Prompt, der einen Dateipfad erwähnt, Dateiwerkzeuge aktivieren; eine Frage zu Aktienkursen würde nur den Finanzserver laden. Dies vermeidet den Token-Overhead irrelevanter Server-Metadaten.

Für wen das relevant ist

Entwickler, die Claude mit mehreren MCP-Servern betreiben, insbesondere in automatisierten Pipelines oder benutzerdefinierten Frontends, bei denen Token-Effizienz zählt.

📖 Vollständige Quelle lesen: r/ClaudeAI

Ad

👀 Siehe auch

Claude Stealth-Modus-Anweisung für autonome KI-Ausführung
Tipps

Claude Stealth-Modus-Anweisung für autonome KI-Ausführung

Ein Reddit-Nutzer teilt eine 'Stealth-Modus'-Anweisung, die Claude zwingt, leise und autonom zu arbeiten und vollständige Ergebnisse in einem Durchgang zu liefern, ohne Konversationsausgabe, bis die Arbeit abgeschlossen ist.

OpenClawRadar
Browser-Agenten haben mein API-Budget aufgefressen: Die versteckten Kosten von Beobachtungsschleifen
Tipps

Browser-Agenten haben mein API-Budget aufgefressen: Die versteckten Kosten von Beobachtungsschleifen

Betreiben Sie KI-Agenten für reale Webaufgaben? Ein Reddit-Nutzer berichtet, dass Browser-Beobachtungsschleifen – nicht das Modell – der dominierende Kostenfaktor sind. Jeder Klick, jedes Warten und Beobachten löst eine Runde aus, und eine schlechte Snapshot-Qualität erzeugt eine sich verstärkende Fehlerspirale, die die Token-Nutzung aufbläht. Isolierte Browserumgebungen und schnellere Agentenausführung sind wichtige Kosteneinsparmaßnahmen.

OpenClawRadar
Anthropics undokumentiertes OAuth-Rate-Limit-Pool erfordert Claude Code System-Prompt
Tipps

Anthropics undokumentiertes OAuth-Rate-Limit-Pool erfordert Claude Code System-Prompt

Bei der Verwendung von Anthropic OAuth-Tokens leitet die API Anfragen basierend darauf, ob Ihr System-Prompt sich als Claude Code identifiziert, an das Claude Code-Ratenlimit-Pool weiter. Das Hinzufügen von "You are Claude Code, Anthropic's official CLI for Claude." zu Ihrem System-Prompt löst mysteriöse 429-Fehler.

OpenClawRadar
Claude Code: Kontextverwaltung statt Prompt-Engineering
Tipps

Claude Code: Kontextverwaltung statt Prompt-Engineering

Ein Entwickler teilt mit, dass nach einem Jahr der Nutzung von Claude Code die entscheidende Fähigkeit nicht die Formulierung von Prompts oder die Modellauswahl ist, sondern das Bereitstellen umfassender Projektkontexte im Voraus, um bessere Ergebnisse zu erzielen.

OpenClawRadar