Mesh LLM: Computación de IA Distribuida en Iroh – Ejecuta LLMs en Tus Propias GPUs
Mesh LLM es una plataforma de cómputo de IA distribuida que agrupa GPUs y memoria de varias máquinas y expone todo como una API compatible con OpenAI en http://localhost:9337/v1. Puedes iniciar un nodo, agregar más después, y dejar que la malla decida si un modelo se ejecuta localmente, se enruta a un par que ya lo tenga cargado, o se divide entre varias máquinas.
Cómo funciona
Internamente, Mesh LLM utiliza endpoints de iroh para identidad (clave pública) y redes. No hay un servidor central. iroh maneja el cruce de NAT, hole-punching y retransmisión de respaldo a través de conexiones QUIC. El protocolo define tres ALPNs:
mesh-llm/1– malla principal (gossip, enrutamiento, túneles HTTP, canales de plugins)mesh-llm-control/1– plano de control del propietario (sincronización de configuración, atestación de propiedad)skippy-stage/2– transporte de activación sensible a latencia para modelos divididos
Dentro de la conexión principal, toda comunicación se multiplexa sobre flujos QUIC bidireccionales etiquetados con un solo byte principal:
0x01GOSSIP – anuncios de pares (modelos, GPU, RTT, capacidades)0x04TUNNEL_HTTP – solicitudes de inferencia proxyadas a un par0x05ROUTE_REQUEST – consultar qué modelos aloja un par0x06PEER_DOWN – notificación de par caído0x07PEER_LEAVING – apagado graceful0x08PLUGIN_CHANNEL – RPC de plugin0x0eDIRECT_PATH_REQUEST – compartir direcciones directas para cruce de NAT
Modo dividido ("Skippy")
Para modelos demasiado grandes para una sola GPU (por ejemplo, 235B mixture-of-experts), Mesh LLM tiene un modo dividido que particiona un modelo por rangos de capas en etapas. Las capas 0–15 se ejecutan en un nodo, las 16–31 en el siguiente, y así sucesivamente. Las activaciones fluyen de una etapa a la siguiente a través de flujos QUIC. Varias máquinas modestas pueden juntas ejecutar un modelo que ninguna podría sostener sola.
Arquitectura de plugins
Los plugins declaran sus capacidades en un manifiesto. El tiempo de ejecución los inicia, enruta las llamadas y expone sus capacidades a través de MCP, HTTP, inferencia y eventos de la malla. El catálogo incluye más de 40 modelos, desde modelos de medio billón de parámetros que caben en un portátil hasta los gigantes de 235B.
Para quién es
Equipos que quieren controlar su propia infraestructura de IA: compartir cómputo de GPU de forma privada o pública, ejecutar modelos más grandes sin comprar hardware más grande, y evitar la dependencia de proveedores. Cualquier cliente de OpenAI puede apuntar a localhost:9337 y dejar de preocuparse de dónde ocurre realmente el trabajo.
📖 Lee la fuente completa: HN LLM Tools
👀 Ver también

Beacon: Telemetría de Punto Final de Código Abierto para Agentes de IA Locales
Beacon captura la actividad local de agentes de IA (Claude Code, Codex CLI, Cursor, etc.) y la normaliza en eventos de endpoint para inspección o reenvío a SIEM mediante Wazuh, Elastic, Splunk HEC.

Servidor de Base de Conocimiento de Código Abierto y Orquestador Multiagente para Memoria IA Persistente
Un desarrollador construyó un servidor MCP personalizado en un VPS privado para darle a Claude, Codex y Gemini memoria persistente entre sesiones, con un servidor de base de conocimiento que ingiere bóvedas de Obsidian y un orquestador multiagente llamado Daniel para respaldo.

Juego de Rompecabezas para Bots con Premios: Un Nuevo Desafío para los Programadores de IA
Un intrigante nuevo juego de rompecabezas invita a los codificadores de IA a desatar su creatividad e inteligencia desarrollando soluciones de bots para competir por premios. La iniciativa ha generado entusiasmo en la comunidad de IA, fomentando la creatividad y la competencia.

Línea de Estado Personalizada para Claude Code Muestra Uso de Contexto, Costo y Rama de Git
Un usuario de Reddit creó un script bash que aprovecha la configuración statusLine de Claude Code para mostrar información en tiempo real, incluyendo el uso de la ventana de contexto, el costo de la sesión, el modelo activo y la rama actual de git. El script requiere jq y está disponible en GitHub.