MCP Slim: Lokale Embedding-Suche für MCP-Tools reduziert Kontextüberladung

MCP Slim ist ein Proxy-Tool, das das Kontextaufblähungsproblem von MCP angeht, indem es vollständige Tool-Kataloge durch drei Meta-Tools ersetzt: Suche, Beschreibung und Aufruf. Anstatt alle Tool-Definitionen im Voraus zu laden, sucht das LLM nach dem, was es benötigt, und reduziert so die Nutzung des Kontextfensters um 96 %.
Wichtige Details
Das Tool zielt speziell auf das dokumentierte Kontextaufblähungsproblem von MCP ab, bei dem das Verbinden einiger Server vor der ersten Nachricht über 55.000 Token für Tool-Definitionen verbrauchen kann. Der Hauptunterschied von MCP Slim zu anderen Proxys wie mcp-compressor und MCProxy ist die Verwendung semantischer Suche mit einem lokalen MiniLM-Embedding-Modell. Dies ermöglicht es, relevante Tools ohne Schlüsselwortüberschneidung zu finden – zum Beispiel kann "eine Notiz speichern" create_entities finden.
Das Tool läuft vollständig offline und benötigt keine API-Schlüssel. Es funktioniert mit jedem stdio-MCP-Client, einschließlich Claude Desktop, Cursor, Cline, Windsurf und Zed.
Installation und Einrichtung
Die Installation erfolgt über: npx mcp-slim init
Das GitHub-Repository ist verfügbar unter: https://github.com/dopatools/mcp-slim
Der Autor (/u/OpportunitySpare2441) hat angeboten, Fragen zur Architektur oder zu Kompromissen zu beantworten.
📖 Read the full source: r/LocalLLaMA
👀 Siehe auch

Selbstentwickelnde Fähigkeitsmuster-Validierung: Ergebnisse des 5-Runden-Experiments
Ein Entwickler testete das Self-Evolving Skill-Designmuster für Claude Code mit einem 5-Runden-Experiment an einer MySQL-Datenbank mit 29 Tabellen und 590 MB Smart-Building-Management-Daten. Zu den wichtigsten Ergebnissen gehören eine 63,6 %ige Five-Gate-Ablehnungsrate, inkrementelle Konvergenz und 100 % Genauigkeit, wobei kein falsches Wissen überlebte.

Entwickler teilt hybride KI-Codier-Workflow: Claude für die Planung, lokale Modelle für die Ausführung
Ein Entwickler baute eine Pipeline mit Claude 3.5 Sonnet für die Aufgabenplanung und lokalen Qwen2.5-Coder-Modellen über Ollama für die Codegenerierung und erreichte eine Reduzierung der Tokens um 85 % im Vergleich zur alleinigen Nutzung von Claude.

GLM-5-Turbo zeigt niedrige Tool-Call-Fehlerraten in Benutzertests
Das z-ai/glm-5-turbo-Modell zeigt in Tests eine durchschnittliche Tool-Call-Fehlerrate von 0,57 %, was deutlich niedriger ist als die ~3 %-Rate von GLM-5. Ein Nutzer berichtete, es erfolgreich mit einem CLI-Tool verwendet zu haben, um einen 97.000 Wörter umfassenden Fantasy-Roman mit minimalen Problemen zu schreiben.

Ein geologisches Uhrwerk mit Claude Code erstellen: Single HTML + Three.js
Ein Produktdesigner hat eona.earth entwickelt, eine geologische Uhr, die die 4,5 Milliarden Jahre der Erde auf 12 Stunden abbildet. Dafür nutzte er Claude Code, Three.js und benutzerdefinierte WebGL-Shader – alles als einzelne HTML-Datei ohne Build-Schritt.