Mesh LLM: Computação Distribuída de IA no Iroh – Execute LLMs em Suas Próprias GPUs

✍️ OpenClawRadar📅 Publicado: July 12, 2026🔗 Source
Ad

Mesh LLM é uma plataforma de computação de IA distribuída que agrupa GPUs e memória de várias máquinas e expõe tudo como uma única API compatível com OpenAI em http://localhost:9337/v1. Você pode iniciar um nó, adicionar mais depois, e deixar a malha decidir se um modelo é executado localmente, roteado para um par que já o carregou, ou dividido entre várias máquinas.

Como Funciona

Por baixo dos panos, o Mesh LLM usa endpoints iroh para identidade (chave pública) e rede. Não há servidor central. O iroh lida com travessia NAT, furar firewall e fallback de relay via conexões QUIC. O protocolo define três ALPNs:

  • mesh-llm/1 – malha principal (gossip, roteamento, túneis HTTP, canais de plugin)
  • mesh-llm-control/1 – plano de controle do proprietário (sincronização de configuração, atestação de propriedade)
  • skippy-stage/2 – transporte de ativação sensível a latência para modelos divididos

Dentro da conexão principal, toda comunicação é multiplexada em streams QUIC bidirecionais identificados por um único byte inicial:

  • 0x01 GOSSIP – anúncios de pares (modelos, GPU, RTT, capacidades)
  • 0x04 TUNNEL_HTTP – requisições de inferência proxy para um par
  • 0x05 ROUTE_REQUEST – consulta quais modelos um par hospeda
  • 0x06 PEER_DOWN – notificação de par inativo
  • 0x07 PEER_LEAVING – desligamento gracioso
  • 0x08 PLUGIN_CHANNEL – RPC de plugin
  • 0x0e DIRECT_PATH_REQUEST – compartilha endereços diretos para travessia NAT
Ad

Modo Dividido ("Skippy")

Para modelos grandes demais para uma única GPU (por exemplo, 235B mixture-of-experts), o Mesh LLM tem um modo dividido que particiona um modelo por intervalos de camadas em estágios. Camadas 0–15 são executadas em um nó, 16–31 no próximo, e assim por diante. As ativações fluem de um estágio para o próximo via streams QUIC. Várias máquinas modestas podem juntas executar um modelo que nenhuma conseguiria segurar sozinha.

Arquitetura com Plugins

Plugins declaram suas capacidades em um manifesto. O runtime os inicia, roteia chamadas, e expõe suas capacidades via MCP, HTTP, inferência e eventos da malha. O catálogo vem com mais de 40 modelos — desde modelos de meio bilhão de parâmetros que cabem em um laptop até os gigantes de 235B.

Para Quem é

Equipes que querem controlar sua própria infraestrutura de IA: compartilhar computação GPU de forma privada ou pública, executar modelos maiores sem comprar hardware maior, e evitar dependência de fornecedor. Qualquer cliente OpenAI pode apontar para localhost:9337 e parar de se importar onde o trabalho realmente acontece.

📖 Leia o código-fonte completo: HN LLM Tools

Ad

👀 See Also