MCP-Server ermöglicht es Claude, zur Laufzeit benutzerdefinierte Tools zu erstellen und auszuführen

Ein Entwickler hat einen MCP-Server gebaut, der es Claude ermöglicht, neue Tools zur Laufzeit zu erstellen, zu aktualisieren und auszuführen, ohne dass eine erneute Bereitstellung erforderlich ist. Im Gegensatz zu Standard-MCP-Setups, bei denen die Tools zum Zeitpunkt der Bereitstellung festgelegt sind, ermöglicht dieses System die dynamische Erstellung von Tools.
Kernarchitektur
Der Server implementiert fünf Kern-MCP-Tools:
- Tools auflisten — gibt verfügbare Tools zurück
- Tool abrufen — holt die vollständige Tool-Definition einschließlich Code
- Tool erstellen — speichert ein neues Tool in einer Datenbank-Registry
- Tool aktualisieren — modifiziert ein bestehendes Tool
- Tool ausführen — führt ein gespeichertes Tool anhand seines Namens aus
Tool-Ausführungsprozess
Das Run Tool Meta-Tool funktioniert wie folgt:
- Suchte das angeforderte Tool in einer MySQL-Tabelle
- Holt dessen Code
- Übergibt Parameter als Kontext
- Führt es in einem Deno-Subprozess mit eingeschränkten Berechtigungen aus
- Gibt das Ergebnis zurück
Sandbox-Implementierung
Der Entwickler bewertete Node VM, isolated-vm und Docker, bevor er sich für Deno als Sandbox entschied. Deno wurde ausgewählt, weil:
- Sauberes Berechtigungsmodell mit granularer Netzwerk-/Dateisystem-/Subprozesskontrolle
- Native npm-Unterstützung
- TypeScript eingebaut
- ~50 ms Kaltstart vs. 500 ms+ für Docker
Die Sandbox verwendet diese Flags: --allow-net --deny-read --deny-write --deny-run --deny-ffi. Dies ermöglicht es dem Tool-Code, HTTP-Anfragen zu stellen und npm-Pakete zu verwenden, verhindert jedoch Dateisystemzugriff oder das Starten von Prozessen.
Tool-Code-Format
Tool-Code ist JavaScript/TypeScript, das ein Kontextobjekt für Parameter erhält. Beispiel aus der Quelle:
const response = await fetch(`https://api.example.com/${context.city}`);
const data = await response.json();
return { temp: data.temp, conditions: data.weather[0].description };
Selbsterweiterungsfähigkeit
Das System ermöglicht eine Selbsterweiterungsschleife: Claude erkennt, dass es eine Fähigkeit benötigt → erstellt das Tool → verwendet es sofort → aktualisiert es, wenn das Ergebnis nicht stimmt. Dies ermöglicht es dem System, im Laufe der Zeit leistungsfähiger zu werden, ohne dass ein Entwickler eingreifen muss.
Die Implementierung basiert auf n8n als MCP-Server mit MySQL zur Tool-Speicherung und läuft seit einigen Monaten in der Produktion.
📖 Read the full source: r/ClaudeAI
👀 Siehe auch

Clawdwatch: Open-Source-OSINT-Tool zur Echtzeit-Flugverfolgung, Nachrichtensammlung und Alarmierung
Clawdwatch ist ein CLI-Tool, das Live-Flugdaten vom OpenSky Network abruft, Nachrichten von Al Jazeera und AP scraped und Telegram-Alarme für Militärflugzeuge oder Notfall-Squawks senden kann. Es läuft lokal mit npm install und verfolgt in Echtzeit über 204 Flüge über dem Nahen Osten.

Aufbau eines agentischen RAG für Obsidian mit Claude und einer Evaluierungsumgebung zur Erkennung von Halluzinationen
Ein Entwickler baute ein agentisches RAG-System über einem Obsidian-Vault, damit Claude Fragen aus Ingenieurbüchern beantworten kann, und erstellte dann ein Evaluierungs-Tool mit Claude Sonnet als Richter, um zu erkennen, wann der Agent zuversichtlich falsch lag. Rubrik-Iterationen verbesserten die Übereinstimmung zwischen Richter und Mensch von 39 % auf 94 %.

Wie Mendral die LLM-Kosten durch ein Upgrade auf Opus senkte: Triager-Muster, SQL-Zugriff und Sub-Agent-Architektur
Mendral wechselte für die Analyse von CI-Fehlern von Sonnet zu Opus 4.6, senkte aber die Kosten, indem es einen Haiku-Triager einsetzte, der 80 % der Fehler abfing, den Agenten SQL-Zugriff auf ClickHouse statt Log-Push gab und günstige Unteragenten für die eigentliche Detektivarbeit einsetzte.

OpenClaw-Modellleistungsüberprüfung: Codex 5.3 führt, GLM-Modelle enttäuschen
Ein Entwickler testete mehrere KI-Modelle mit OpenClaw und fand heraus, dass Codex 5.3 mit einer Bewertung von 9/10 am besten abschneidet, während GLM 4.7 und GLM 5 mit 5/10 bewertet wurden, was auf hohen Token-Verbrauch, langsame Antworten und inkonsistente Ausgaben zurückzuführen ist.