Configuration des serveurs MCP dans l'interface Web llama-server : un guide pratique

llama-server a récemment ajouté la prise en charge du MCP (Model Context Protocol), et un utilisateur de Reddit a documenté les étapes exactes pour le faire fonctionner dans l'interface web. Ce guide fournit des instructions de configuration concrètes pour les développeurs qui souhaitent intégrer des serveurs MCP avec leur instance locale de llama-server.
Prérequis de configuration
Premièrement, assurez-vous que uv est installé. Le guide fait référence à la documentation d'installation officielle à https://docs.astral.sh/uv/getting-started/installation/.
Fichier de configuration
Créez un fichier config.json dans le répertoire de votre choix avec des définitions de serveurs MCP. L'exemple inclut trois serveurs :
{
"mcpServers": {
"time": {
"command": "uv",
"args": ["run", "mcp-server-time", "--local-timezone=America/Chicago"]
},
"fetch": {
"command": "uvx",
"args": ["mcp-server-fetch"]
},
"ddg-search": {
"command": "uvx",
"args": ["duckduckgo-mcp-server"]
}
}
}
Exécution du proxy
Depuis le même répertoire, exécutez cette commande :
uvx mcp-proxy --named-server-config config.json --allow-origin "*" --port 8001 --stateless
Lorsque vous exécutez cette commande, elle liste le nom de chaque serveur MCP. Vous devez remplacer le sse à la fin de chaque URL par mcp pour que les serveurs fonctionnent dans l'interface web de llama-server.
Exemple : Changez http://127.0.0.1:8001/servers/time/sse en http://127.0.0.1:8001/servers/time/mcp
Configuration de l'interface web
Dans l'interface web de llama-server, allez dans Paramètres → MCP → Ajouter un nouveau serveur, et ajoutez chaque serveur de votre configuration. Par exemple :
http://127.0.0.1:8001/servers/time/mcphttp://127.0.0.1:8001/servers/fetch/mcphttp://127.0.0.1:8001/servers/ddg-search/mcp
Cliquez sur Ajouter pour terminer l'ajout de chaque serveur, puis activez le bouton bascule pour l'activer. Les serveurs MCP configurés devraient maintenant fonctionner dans l'interface web de llama-server.
📖 Lire la source complète : r/LocalLLaMA
👀 See Also

Application de centre de commandement personnalisée pour OpenClaw : PWA React avec proxy WebSocket et Tailscale
Un développeur a construit un centre de commandement React PWA pour sa configuration OpenClaw, avec un tableau de bord des agents en direct, un poste de trading et des notifications push, en utilisant un modèle de proxy WebSocket pour faire le pont entre la passerelle OpenClaw limitée à la boucle locale et les appareils sur un maillage Tailscale.

Utilisez des exécuteurs de tâches pour les tâches de codage courantes
Ham Vocke explique comment utiliser de simples scripts bash ou Makefiles comme exécuteurs de tâches pour standardiser les commandes courantes comme build, test et format à travers les référentiels.

Exécution de Qwen3.6-35B-A3B avec ~190k de contexte sur 8 Go de VRAM + 32 Go de RAM – Configuration et benchmarks
Un utilisateur de Reddit partage une configuration fonctionnelle de llama.cpp pour les modèles GGUF Qwen3.6-35B-A3B sur une RTX 4060 (8 Go de VRAM) + 32 Go DDR5, atteignant 37-51 tok/s à 192k de contexte en utilisant TurboQuant et des indicateurs spécifiques.

OpenClaw Memory Journey : Recherche intégrée vs MemPalace pour le rappel de session en temps réel
Un développeur compare la recherche intégrée, QMD et MemPalace sur Mac Intel. L'indexation en temps réel pose problème ; il adopte une stratégie de rappel fractionné avec réindexation cronée.