Mesh LLM: Computación de IA Distribuida en Iroh – Ejecuta LLMs en Tus Propias GPUs
Mesh LLM es una plataforma de cómputo de IA distribuida que agrupa GPUs y memoria de varias máquinas y expone todo como una API compatible con OpenAI en http://localhost:9337/v1. Puedes iniciar un nodo, agregar más después, y dejar que la malla decida si un modelo se ejecuta localmente, se enruta a un par que ya lo tenga cargado, o se divide entre varias máquinas.
Cómo funciona
Internamente, Mesh LLM utiliza endpoints de iroh para identidad (clave pública) y redes. No hay un servidor central. iroh maneja el cruce de NAT, hole-punching y retransmisión de respaldo a través de conexiones QUIC. El protocolo define tres ALPNs:
mesh-llm/1– malla principal (gossip, enrutamiento, túneles HTTP, canales de plugins)mesh-llm-control/1– plano de control del propietario (sincronización de configuración, atestación de propiedad)skippy-stage/2– transporte de activación sensible a latencia para modelos divididos
Dentro de la conexión principal, toda comunicación se multiplexa sobre flujos QUIC bidireccionales etiquetados con un solo byte principal:
0x01GOSSIP – anuncios de pares (modelos, GPU, RTT, capacidades)0x04TUNNEL_HTTP – solicitudes de inferencia proxyadas a un par0x05ROUTE_REQUEST – consultar qué modelos aloja un par0x06PEER_DOWN – notificación de par caído0x07PEER_LEAVING – apagado graceful0x08PLUGIN_CHANNEL – RPC de plugin0x0eDIRECT_PATH_REQUEST – compartir direcciones directas para cruce de NAT
Modo dividido ("Skippy")
Para modelos demasiado grandes para una sola GPU (por ejemplo, 235B mixture-of-experts), Mesh LLM tiene un modo dividido que particiona un modelo por rangos de capas en etapas. Las capas 0–15 se ejecutan en un nodo, las 16–31 en el siguiente, y así sucesivamente. Las activaciones fluyen de una etapa a la siguiente a través de flujos QUIC. Varias máquinas modestas pueden juntas ejecutar un modelo que ninguna podría sostener sola.
Arquitectura de plugins
Los plugins declaran sus capacidades en un manifiesto. El tiempo de ejecución los inicia, enruta las llamadas y expone sus capacidades a través de MCP, HTTP, inferencia y eventos de la malla. El catálogo incluye más de 40 modelos, desde modelos de medio billón de parámetros que caben en un portátil hasta los gigantes de 235B.
Para quién es
Equipos que quieren controlar su propia infraestructura de IA: compartir cómputo de GPU de forma privada o pública, ejecutar modelos más grandes sin comprar hardware más grande, y evitar la dependencia de proveedores. Cualquier cliente de OpenAI puede apuntar a localhost:9337 y dejar de preocuparse de dónde ocurre realmente el trabajo.
📖 Lee la fuente completa: HN LLM Tools
👀 Ver también

Usuario de Reddit experimenta con agentes de programación que aprenden de fallos para romper bucles de reintento.
Un desarrollador en r/LocalLLaMA describe experimentar con agentes de programación que aprenden de los fallos almacenando causas raíz simplificadas y emparejando soluciones, reduciendo bucles de error repetitivos.

Resultados de Referencia: 331 Modelos GGUF Probados en Mac Mini M4 de 16GB
Una evaluación comparativa de 331 modelos GGUF en un Mac Mini M4 con 16 GB de RAM revela que solo 11 modelos son Pareto-óptimos, todos con arquitectura Mixture-of-Experts. Los modelos Mixture-of-Experts dominan el rendimiento con una mediana de 20.0 tokens/segundo frente a 4.4 de los modelos densos.

ClaudeHive: Interfaz Web para Gestionar Sesiones Paralelas de Código Claude
ClaudeHive es una interfaz web que maneja sesiones paralelas de Claude Code, permitiendo a los usuarios definir plantillas de prompts con marcadores de posición, ejecutarlas en lote a través de múltiples entradas con concurrencia configurable y revisar todos los resultados en un solo lugar. Incluye una herramienta CLI para que los agentes gestores generen y coordinen agentes trabajadores.

Servidor de Base de Conocimiento de Código Abierto y Orquestador Multiagente para Memoria IA Persistente
Un desarrollador construyó un servidor MCP personalizado en un VPS privado para darle a Claude, Codex y Gemini memoria persistente entre sesiones, con un servidor de base de conocimiento que ingiere bóvedas de Obsidian y un orquestador multiagente llamado Daniel para respaldo.