Claude Code lädt Tool-Schemata per ToolSearch lazy, um Token zu sparen

Eine Reddit-Analyse des System-Prompts von Claude Code zeigt, dass Tools lazy-geladen werden, um den Token-Verbrauch zu senken. Statt das vollständige Schema jedes Tools mit jeder Anfrage zu senden, sendet Claude Code eine Liste der Tool-Namen in einem <system-reminder>-Tag und weist das Modell an, zuerst ToolSearch aufzurufen, um das Schema für jedes Tool zu laden.
Wie es funktioniert
Der System-Prompt enthält eine Anweisung wie diese:
<system-reminder> Die folgenden zurückgestellten Tools sind jetzt über ToolSearch verfügbar. Ihre Schemata sind NICHT geladen – ein direkter Aufruf führt zu einem InputValidationError. Verwenden Sie ToolSearch mit der Abfrage "select:<name>[,<name>...]", um die Tool-Schemata vor dem Aufruf zu laden:AskUserQuestion CronCreate CronDelete CronList EnterPlanMode EnterWorktree ExitPlanMode ExitWorktree Monitor NotebookEdit PushNotification RemoteTrigger TaskOutput TaskStop TodoWrite WebFetch WebSearch
[+ ~130 MCP-Tools (Slack, Notion, Gmail...)] </system-reminder>
Der <system-reminder> wird nur in der ersten Benutzernachricht des Gesprächs eingefügt. Ein ähnlicher Block listet Fähigkeiten mit einzeiligen Beschreibungen auf.
Auswirkungen auf den Token-Verbrauch
Laut dem Beitrag verbrauchten die Systemanweisungen zusammen mit den Erinnerungen bei einer einfachen Testnachricht mit "hi" bereits 38k Tokens. Das vollständige Laden aller Tool-Schemata würde diesen Verbrauch drastisch erhöhen – daher der Ansatz des verzögerten Ladens.
Praktische Implikationen
Wenn Sie auf Claude Code oder ähnlichen agentenbasierten Systemen aufbauen, lohnt es sich, dieses Muster zu übernehmen:
- Verschieben Sie Schemata für selten genutzte Tools, bis sie benötigt werden.
- Verwenden Sie einen
ToolSearch-ähnlichen Befehl, um explizit Schemata anzufordern. - Halten Sie Erinnerungen innerhalb der ersten Nachricht, um Kontextwiederholungen zu vermeiden.
Das bedeutet auch, dass Sie beim Schreiben benutzerdefinierter Tools für Claude Code sicherstellen müssen, dass das Modell sie über ToolSearch finden kann – sonst sind sie unsichtbar oder verursachen Validierungsfehler.
📖 Read the full source: r/ClaudeAI
👀 Siehe auch

Vergängliche OpenClaw-Einrichtungen mit Netzwerk-Sandboxing und automatischem Abbau
Ein Setup, das OpenClaw in einer ephemeren VM mit einer Netzwerk-Ausgangs-Allowlist startet, API-Schlüssel in RAM-gestützten Speicher injiziert und einen automatischen Abbau nach 2 Stunden beinhaltet. Alle LLM-Aufrufe werden für die Wiedergabe in SQLite aufgezeichnet.

So verschieben oder benennen Sie Claude-Code-Projektordner, ohne Sitzungsverlauf zu verlieren
Claude Code speichert die Sitzungshistorie mithilfe absoluter Projektpfade, sodass das Verschieben oder Umbenennen von Ordnern mit mv den Zugriff auf Sitzungen unterbricht. Das Tool clamp behebt dies, indem es Sitzungsdaten migriert, um sie an neue Pfade anzupassen.

Hollow Agent OS: Lokale KI-Arbeiter rufen Claude als leitenden Architekten, wenn sie feststecken
Das Hollow Agent OS verwendet lokale Qwen-Modelle, die rund um die Uhr laufen. Wenn sie jedoch auf Logikfehler stoßen oder größere Änderungen benötigen, lösen sie über MCP einen Claude-Aufruf aus. Claude reorganisiert Dateistrukturen, überprüft Code und fungiert als Manager für autonome lokale Arbeiter.

NLA wandelt die internen Aktivierungen von Gemma 3 in lesbaren Text für jedes Token um
Anthropic veröffentlichte Natural Language Autoencoders (NLA), die den internen Zustand eines Modells in Text dekodieren. Gepaart mit Gemma 3 erklärt der Auto Verbalizer, was das Modell bei jedem generierten Token „dachte". Gewichte gibt es auf Hugging Face; eine Demo auf Neuronpedia.