Configurando Servidores MCP no Web UI do llama-server: Um Guia Prático

O llama-server adicionou recentemente suporte ao MCP (Model Context Protocol), e um usuário do Reddit documentou os passos exatos para fazê-lo funcionar na interface web. Este guia fornece instruções concretas de configuração para desenvolvedores que desejam integrar servidores MCP com sua instância local do llama-server.
Requisitos de Configuração
Primeiro, certifique-se de que o uv está instalado. O guia faz referência à documentação oficial de instalação em https://docs.astral.sh/uv/getting-started/installation/.
Arquivo de Configuração
Crie um arquivo config.json no diretório de sua escolha com definições de servidores MCP. O exemplo inclui três servidores:
{
"mcpServers": {
"time": {
"command": "uv",
"args": ["run", "mcp-server-time", "--local-timezone=America/Chicago"]
},
"fetch": {
"command": "uvx",
"args": ["mcp-server-fetch"]
},
"ddg-search": {
"command": "uvx",
"args": ["duckduckgo-mcp-server"]
}
}
}
Executando o Proxy
Do mesmo diretório, execute este comando:
uvx mcp-proxy --named-server-config config.json --allow-origin "*" --port 8001 --stateless
Ao executar este comando, ele lista o nome de cada servidor MCP. Você precisa substituir o sse no final de cada URL por mcp para que os servidores funcionem na interface web do llama-server.
Exemplo: Altere http://127.0.0.1:8001/servers/time/sse para http://127.0.0.1:8001/servers/time/mcp
Configuração da Interface Web
Na interface web do llama-server, vá para Configurações → MCP → Adicionar Novo Servidor e adicione cada servidor do seu config. Por exemplo:
http://127.0.0.1:8001/servers/time/mcphttp://127.0.0.1:8001/servers/fetch/mcphttp://127.0.0.1:8001/servers/ddg-search/mcp
Clique em Adicionar para finalizar a adição de cada servidor, depois marque a alternância para ativá-lo. Os servidores MCP configurados agora devem funcionar na interface web do llama-server.
📖 Leia a fonte completa: r/LocalLLaMA
👀 See Also

Pilha de Rastreamento de LLM de Ponta a Ponta: Do Toque de Tecla ao Token Transmitido
Um engenheiro de software criou um documento abrangente que rastreia cada camada da pilha ao enviar um prompt para um LLM, cobrindo contagem de tokens no lado do cliente, protocolos de rede, gateways de API, classificadores de segurança, tokenização, cache KV, pipeline de amostragem e mecânicas de streaming.

Avaliação de Chatbot RAG: Como uma Varredura de Modelo + Correções de Recuperação Reduziram Custos em 79% e Aumentaram a Qualidade em 19%
Um desenvolvedor avaliou um bot RAG de suporte ao cliente e encontrou configurações incorretas de recuperação, falhas no avaliador heurístico e um modelo mais barato que superou o de produção. A qualidade melhorou de 6,62 para 7,88 enquanto o custo caiu de $0,002420 para $0,000509 por sessão.

Corrigindo Problemas de Autonomia do Agente OpenClaw: Arquivos de Habilidades, Seleção de Ferramentas e Configuração do Cron
Um desenvolvedor compartilha soluções para agentes OpenClaw que param de funcionar autonomamente após a configuração inicial. As principais correções incluem usar arquivos de habilidades externos em vez de instruções de chat, substituir ferramentas de navegador por ferramentas baseadas em API ou scripts Puppeteer, e configurar corretamente os trabalhos cron.

Método de Codificação de IA com Rédea Curta: Vença a Fábula Mantendo o Controle
O método de coleira curta de Greg Slepak para agentes de IA de código: planejar, revisar cada diff, negar mudanças ruins, commit após subtarefas. Supera a qualidade do Fable mantendo o desenvolvedor no loop.