Support MCP intégré à llama.cpp avec de nouvelles fonctionnalités d'interface Web

La demande de tirage (pull request) pour le Model Context Protocol (MCP) de llama.cpp a été fusionnée dans le dépôt principal. Cette intégration ajoute la prise en charge du MCP aux composants llama-server et WebUI, permettant plusieurs nouvelles capacités pour les agents de codage IA et les flux de travail LLM locaux.
Fonctionnalités clés ajoutées
Selon le matériel source, cette fusion débloque les fonctionnalités suivantes :
- Prise en charge du MCP pour llama-server/WebUI
- Capacité d'appels d'outils
- Implémentation de la boucle agentique
- Fonctionnalité de sélecteur de serveur
- Gestion des ressources
- Pièces jointes de prompts
- Navigateur de fichiers/ressources
- Proxy CORS backend activé avec le drapeau
--webui-mcp-proxy
Détails techniques
La demande de tirage spécifique qui a été fusionnée est PR #18655 dans le dépôt llama.cpp. Le contributeur mentionne utiliser OpenWebUI en combinaison avec llama.cpp WebUI et attendait cette fusion.
Pour les développeurs travaillant avec des LLM locaux et des agents de codage IA, cette intégration signifie que vous pouvez maintenant utiliser des outils compatibles MCP directement via l'interface WebUI de llama.cpp. Le drapeau --webui-mcp-proxy active la fonctionnalité de proxy CORS pour le backend, ce qui est particulièrement utile pour les interfaces web.
Cette mise à jour s'adresse principalement aux développeurs qui utilisent llama.cpp pour l'inférence LLM locale et souhaitent intégrer des outils compatibles MCP dans leur flux de travail via l'interface WebUI.
📖 Lire la source complète : r/LocalLLaMA
👀 See Also

OpenClawDreams : Une extension de simulateur de rêves pour les agents OpenClaw
OpenClawDreams est une extension qui ajoute un processus de réflexion en arrière-plan et un cycle de rêve nocturne aux agents OpenClaw. Il capture des résumés chiffrés des conversations dans une base de données SQLite locale, les traite pendant les cycles en arrière-plan et génère des aperçus consolidés qui sont intégrés dans la mémoire persistante de l'agent.

Cerveau : Un système de mémoire d'erreurs persistantes pour le code Claude via MCP
Brain est un serveur MCP open-source qui offre à Claude Code une mémoire persistante et inter-projets pour les erreurs et leurs solutions. Il capture le contexte des erreurs, suggère des correctifs éprouvés avec des scores de confiance, et construit un réseau de synapses pondéré connectant les erreurs, les solutions et les modules de code à travers tous les projets.

Claude Code Limiter : Limiteur de débit auto-hébergé pour les abonnements partagés Claude Code
claude-code-limiter est un outil auto-hébergeable qui ajoute des limites de taux par utilisateur aux abonnements partagés Claude Code, avec des fonctionnalités comme des quotas par modèle, des budgets de crédits, des fenêtres glissantes de 24h, des règles horaires et un tableau de bord en temps réel.

Développeur Atteint une Latence STT/TTS Inférieure à la Seconde avec des Serveurs Locaux Whisper et Coqui-TTS
Un développeur a rendu open source des implémentations de serveur local pour Whisper STT et Coqui TTS qui atteignent une latence d'environ 0,2 s pour la reconnaissance vocale et d'environ 250 ms pour la synthèse vocale, permettant des agents d'IA conversationnels sans dépendances cloud.