Mesh LLM: Computación de IA Distribuida en Iroh – Ejecuta LLMs en Tus Propias GPUs

✍️ OpenClawRadar📅 Publicado: 12 de julio de 2026🔗 Source
Ad

Mesh LLM es una plataforma de cómputo de IA distribuida que agrupa GPUs y memoria de varias máquinas y expone todo como una API compatible con OpenAI en http://localhost:9337/v1. Puedes iniciar un nodo, agregar más después, y dejar que la malla decida si un modelo se ejecuta localmente, se enruta a un par que ya lo tenga cargado, o se divide entre varias máquinas.

Cómo funciona

Internamente, Mesh LLM utiliza endpoints de iroh para identidad (clave pública) y redes. No hay un servidor central. iroh maneja el cruce de NAT, hole-punching y retransmisión de respaldo a través de conexiones QUIC. El protocolo define tres ALPNs:

  • mesh-llm/1 – malla principal (gossip, enrutamiento, túneles HTTP, canales de plugins)
  • mesh-llm-control/1 – plano de control del propietario (sincronización de configuración, atestación de propiedad)
  • skippy-stage/2 – transporte de activación sensible a latencia para modelos divididos

Dentro de la conexión principal, toda comunicación se multiplexa sobre flujos QUIC bidireccionales etiquetados con un solo byte principal:

  • 0x01 GOSSIP – anuncios de pares (modelos, GPU, RTT, capacidades)
  • 0x04 TUNNEL_HTTP – solicitudes de inferencia proxyadas a un par
  • 0x05 ROUTE_REQUEST – consultar qué modelos aloja un par
  • 0x06 PEER_DOWN – notificación de par caído
  • 0x07 PEER_LEAVING – apagado graceful
  • 0x08 PLUGIN_CHANNEL – RPC de plugin
  • 0x0e DIRECT_PATH_REQUEST – compartir direcciones directas para cruce de NAT
Ad

Modo dividido ("Skippy")

Para modelos demasiado grandes para una sola GPU (por ejemplo, 235B mixture-of-experts), Mesh LLM tiene un modo dividido que particiona un modelo por rangos de capas en etapas. Las capas 0–15 se ejecutan en un nodo, las 16–31 en el siguiente, y así sucesivamente. Las activaciones fluyen de una etapa a la siguiente a través de flujos QUIC. Varias máquinas modestas pueden juntas ejecutar un modelo que ninguna podría sostener sola.

Arquitectura de plugins

Los plugins declaran sus capacidades en un manifiesto. El tiempo de ejecución los inicia, enruta las llamadas y expone sus capacidades a través de MCP, HTTP, inferencia y eventos de la malla. El catálogo incluye más de 40 modelos, desde modelos de medio billón de parámetros que caben en un portátil hasta los gigantes de 235B.

Para quién es

Equipos que quieren controlar su propia infraestructura de IA: compartir cómputo de GPU de forma privada o pública, ejecutar modelos más grandes sin comprar hardware más grande, y evitar la dependencia de proveedores. Cualquier cliente de OpenAI puede apuntar a localhost:9337 y dejar de preocuparse de dónde ocurre realmente el trabajo.

📖 Lee la fuente completa: HN LLM Tools

Ad

👀 Ver también

Beacon: Telemetría de Punto Final de Código Abierto para Agentes de IA Locales
Herramientas

Beacon: Telemetría de Punto Final de Código Abierto para Agentes de IA Locales

Beacon captura la actividad local de agentes de IA (Claude Code, Codex CLI, Cursor, etc.) y la normaliza en eventos de endpoint para inspección o reenvío a SIEM mediante Wazuh, Elastic, Splunk HEC.

OpenClawRadar
Servidor de Base de Conocimiento de Código Abierto y Orquestador Multiagente para Memoria IA Persistente
Herramientas

Servidor de Base de Conocimiento de Código Abierto y Orquestador Multiagente para Memoria IA Persistente

Un desarrollador construyó un servidor MCP personalizado en un VPS privado para darle a Claude, Codex y Gemini memoria persistente entre sesiones, con un servidor de base de conocimiento que ingiere bóvedas de Obsidian y un orquestador multiagente llamado Daniel para respaldo.

OpenClawRadar
Juego de Rompecabezas para Bots con Premios: Un Nuevo Desafío para los Programadores de IA
Herramientas

Juego de Rompecabezas para Bots con Premios: Un Nuevo Desafío para los Programadores de IA

Un intrigante nuevo juego de rompecabezas invita a los codificadores de IA a desatar su creatividad e inteligencia desarrollando soluciones de bots para competir por premios. La iniciativa ha generado entusiasmo en la comunidad de IA, fomentando la creatividad y la competencia.

OpenClawRadar
Línea de Estado Personalizada para Claude Code Muestra Uso de Contexto, Costo y Rama de Git
Herramientas

Línea de Estado Personalizada para Claude Code Muestra Uso de Contexto, Costo y Rama de Git

Un usuario de Reddit creó un script bash que aprovecha la configuración statusLine de Claude Code para mostrar información en tiempo real, incluyendo el uso de la ventana de contexto, el costo de la sesión, el modelo activo y la rama actual de git. El script requiere jq y está disponible en GitHub.

OpenClawRadar