Mesh LLM: Computação Distribuída de IA no Iroh – Execute LLMs em Suas Próprias GPUs

✍️ OpenClawRadar📅 Publicado: July 12, 2026🔗 Source
Ad

Mesh LLM é uma plataforma de computação de IA distribuída que agrupa GPUs e memória de várias máquinas e expõe tudo como uma única API compatível com OpenAI em http://localhost:9337/v1. Você pode iniciar um nó, adicionar mais depois, e deixar a malha decidir se um modelo é executado localmente, roteado para um par que já o carregou, ou dividido entre várias máquinas.

Como Funciona

Por baixo dos panos, o Mesh LLM usa endpoints iroh para identidade (chave pública) e rede. Não há servidor central. O iroh lida com travessia NAT, furar firewall e fallback de relay via conexões QUIC. O protocolo define três ALPNs:

  • mesh-llm/1 – malha principal (gossip, roteamento, túneis HTTP, canais de plugin)
  • mesh-llm-control/1 – plano de controle do proprietário (sincronização de configuração, atestação de propriedade)
  • skippy-stage/2 – transporte de ativação sensível a latência para modelos divididos

Dentro da conexão principal, toda comunicação é multiplexada em streams QUIC bidirecionais identificados por um único byte inicial:

  • 0x01 GOSSIP – anúncios de pares (modelos, GPU, RTT, capacidades)
  • 0x04 TUNNEL_HTTP – requisições de inferência proxy para um par
  • 0x05 ROUTE_REQUEST – consulta quais modelos um par hospeda
  • 0x06 PEER_DOWN – notificação de par inativo
  • 0x07 PEER_LEAVING – desligamento gracioso
  • 0x08 PLUGIN_CHANNEL – RPC de plugin
  • 0x0e DIRECT_PATH_REQUEST – compartilha endereços diretos para travessia NAT
Ad

Modo Dividido ("Skippy")

Para modelos grandes demais para uma única GPU (por exemplo, 235B mixture-of-experts), o Mesh LLM tem um modo dividido que particiona um modelo por intervalos de camadas em estágios. Camadas 0–15 são executadas em um nó, 16–31 no próximo, e assim por diante. As ativações fluem de um estágio para o próximo via streams QUIC. Várias máquinas modestas podem juntas executar um modelo que nenhuma conseguiria segurar sozinha.

Arquitetura com Plugins

Plugins declaram suas capacidades em um manifesto. O runtime os inicia, roteia chamadas, e expõe suas capacidades via MCP, HTTP, inferência e eventos da malha. O catálogo vem com mais de 40 modelos — desde modelos de meio bilhão de parâmetros que cabem em um laptop até os gigantes de 235B.

Para Quem é

Equipes que querem controlar sua própria infraestrutura de IA: compartilhar computação GPU de forma privada ou pública, executar modelos maiores sem comprar hardware maior, e evitar dependência de fornecedor. Qualquer cliente OpenAI pode apontar para localhost:9337 e parar de se importar onde o trabalho realmente acontece.

📖 Leia o código-fonte completo: HN LLM Tools

Ad

👀 See Also

Claude Code obtém verificação de modelos TLA+ via servidor MCP tla-mcp
Tools

Claude Code obtém verificação de modelos TLA+ via servidor MCP tla-mcp

tla-mcp é um novo servidor MCP que permite ao Claude Code chamar o verificador de modelos TLA+ tla-rs como uma ferramenta de primeira classe — valide especificações, execute verificações limitadas com rastros de contraexemplos e reproduza cenários a partir do chat.

OpenClawRadar
🦀
Tools

Lovelace: Gerenciamento de Projetos para Claude Code que Vive no Seu Repositório

Um aplicativo de desktop onde tickets, documentos e registros de sessão são arquivos Markdown dentro do seu repositório. O aplicativo renderiza um quadro kanban a partir dos arquivos, e o Claude trabalha nos mesmos arquivos através de 8 ferramentas MCP. Gratuito, sem necessidade de conta.

OpenClawRadar
Claude-rank: Plugin Claude Code para Auditorias de Visibilidade em Buscas de IA
Tools

Claude-rank: Plugin Claude Code para Auditorias de Visibilidade em Buscas de IA

Claude-rank é um plugin gratuito do Claude Code e CLI que audita os fundamentos técnicos para visibilidade em buscas de IA, lidando com SEO técnico, pontuação de citabilidade de IA, verificações de rastreabilidade para bots de IA e correções automatizadas para problemas de descoberta.

OpenClawRadar
Estrutura de Scaffold Resolve Problemas de Memória e Fluxo de Trabalho do Código Claude
Tools

Estrutura de Scaffold Resolve Problemas de Memória e Fluxo de Trabalho do Código Claude

Scaffold é uma estrutura de 17 habilidades para Claude Code que fornece memória persistente, aplicação de decisões e portões de fluxo de trabalho. Ele usa um sistema de roteamento de modelo de 3 camadas para economia de tokens e pode ser instalado através do menu de plugins do Claude Code.

OpenClawRadar