Suporte do MCP Integrado ao llama.cpp com Novos Recursos de Interface Web

O pull request do Model Context Protocol (MCP) para o llama.cpp foi mesclado no repositório principal. Esta integração adiciona suporte ao MCP aos componentes llama-server e WebUI, permitindo várias novas capacidades para agentes de programação de IA e fluxos de trabalho de LLM locais.
Principais Funcionalidades Adicionadas
De acordo com o material fonte, esta mesclagem desbloqueia as seguintes funcionalidades:
- Suporte ao MCP para llama-server/WebUI
- Capacidade de chamadas de ferramentas
- Implementação de loop agentivo
- Funcionalidade de seletor de servidor
- Gerenciamento de recursos
- Anexos de prompt
- Navegador de arquivos/recursos
- Proxy CORS de backend habilitado com a flag
--webui-mcp-proxy
Detalhes Técnicos
O pull request específico que foi mesclado é PR #18655 no repositório llama.cpp. O colaborador menciona usar OpenWebUI em combinação com llama.cpp WebUI e estava antecipando esta mesclagem.
Para desenvolvedores que trabalham com LLMs locais e agentes de programação de IA, esta integração significa que agora você pode usar ferramentas compatíveis com MCP diretamente através da interface WebUI do llama.cpp. A flag --webui-mcp-proxy habilita a funcionalidade de proxy CORS para o backend, o que é particularmente útil para interfaces baseadas na web.
Esta atualização é principalmente para desenvolvedores que usam llama.cpp para inferência de LLM local e desejam integrar ferramentas compatíveis com MCP em seu fluxo de trabalho através da interface WebUI.
📖 Leia a fonte completa: r/LocalLLaMA
👀 See Also

Contornando o Isolamento da Sandbox NemoClaw para o Agente Local Nemotron 9B
Um desenvolvedor contornou o isolamento da sandbox do NemoClaw para executar um agente totalmente local usando Nemotron 9B com chamadas de ferramentas em uma única RTX 5090. A abordagem envolveu configuração de iptables, um retransmissor TCP personalizado e tradução em tempo real de chamadas de ferramentas.

Experiência do Usuário: Mudando do OpenClaw para o Agente Hermes em LLM Local
Um desenvolvedor relatou a mudança de OpenClaw para Hermes Agent usando Qwen3.5-9B em uma RX 9070 XT com 16 GB de VRAM. O Hermes completou uma tarefa complexa com 5 chamadas de ferramentas corretas, contra mais de 50 etapas do OpenClaw, executando 2:30 minutos mais rápido enquanto mantinha funcionalidades de RAG, chamada de ferramentas e memória persistente.

Tocket CLI: Um Framework de Engenharia de Contexto para Agentes de IA de Programação
Tocket é uma ferramenta CLI que cria uma pasta .context/ com arquivos markdown para agentes de IA manterem a memória do projeto entre sessões. Ele detecta automaticamente as tecnologias do package.json e gera um arquivo .cursorrules pré-configurado.

Meta lança o código do Muse com o modelo Muse Spark 1.2
O novo agente de codificação em terminal Muse Code da Meta, movido pelo Muse Spark 1.2, oferece agentes assíncronos em segundo plano, um runtime exato de replay e capacidades de codificação de longo horizonte.