Mesh LLM: Распределённые AI-вычисления на Iroh – Запуск LLM на ваших собственных GPU

✍️ OpenClawRadar📅 Опубликовано: 12 июля 2026 г.🔗 Source
Ad

Mesh LLM — это распределенная платформа для ИИ-вычислений, которая объединяет GPU и память нескольких машин и предоставляет всё как один API, совместимый с OpenAI, по адресу http://localhost:9337/v1. Вы можете запустить один узел, добавить другие позже, и позволить mesh решать, будет ли модель работать локально, маршрутизироваться к пиру, у которого она уже загружена, или распределяться по нескольким машинам.

Как это работает

Под капотом Mesh LLM использует конечные точки iroh для идентификации (открытый ключ) и сетевого взаимодействия. Центрального сервера нет. iroh обрабатывает обход NAT, hole-punching и резервную ретрансляцию через QUIC-соединения. Протокол определяет три ALPN:

  • mesh-llm/1 — основная mesh (gossip, маршрутизация, HTTP-туннели, каналы плагинов)
  • mesh-llm-control/1 — плоскость управления владельца (синхронизация конфигурации, подтверждение владения)
  • skippy-stage/2 — чувствительный к задержкам транспорт активации для разделенных моделей

Внутри основного соединения вся связь мультиплексируется через двунаправленные QUIC-потоки, помеченные одним ведущим байтом:

  • 0x01 GOSSIP — объявления пиров (модели, GPU, RTT, возможности)
  • 0x04 TUNNEL_HTTP — запросы инференса, проксируемые к пиру
  • 0x05 ROUTE_REQUEST — запрос, какие модели хостит пир
  • 0x06 PEER_DOWN — уведомление о неработающем пире
  • 0x07 PEER_LEAVING — корректное завершение работы
  • 0x08 PLUGIN_CHANNEL — RPC плагина
  • 0x0e DIRECT_PATH_REQUEST — обмен прямыми адресами для обхода NAT
Ad

Режим разделения ("Skippy")

Для моделей, слишком больших для одного GPU (например, 235B mixture-of-experts), Mesh LLM имеет режим разделения, который разбивает модель по диапазонам слоев на стадии. Слои 0–15 выполняются на одном узле, 16–31 — на следующем и так далее. Активации передаются от одной стадии к другой через QUIC-потоки. Несколько скромных машин вместе могут запустить модель, которую ни одна из них не смогла бы удержать в одиночку.

Модульная архитектура

Плагины объявляют свои возможности в манифесте. Среда выполнения запускает их, маршрутизирует вызовы и предоставляет их возможности через MCP, HTTP, инференс и события mesh. В каталоге поставляется 40+ моделей — от моделей с половиной миллиарда параметров, помещающихся на ноутбук, до гигантов на 235B.

Для кого это

Для команд, которые хотят контролировать собственную ИИ-инфраструктуру: делиться вычислительными мощностями GPU приватно или публично, запускать более крупные модели без покупки более мощного оборудования и избежать привязки к вендору. Любой клиент OpenAI может указать localhost:9337 и перестать заботиться о том, где на самом деле выполняется работа.

📖 Читать полный исходник: HN LLM Tools

Ad

👀 Смотрите также

Майк: Открытая юридическая ИИ-система с самостоятельным хостингом и поддержкой множества моделей
Инструменты

Майк: Открытая юридическая ИИ-система с самостоятельным хостингом и поддержкой множества моделей

Mike — это открытая альтернатива Harvey и Legora, предлагающая чат с документами, табличное извлечение данных и шаблоны рабочих процессов — всё это можно разместить на собственном сервере, используя ключи API от Claude или Gemini.

OpenClawRadar
Потрясающий репозиторий навыков OpenClaw предоставляет более 5400 отфильтрованных навыков.
Инструменты

Потрясающий репозиторий навыков OpenClaw предоставляет более 5400 отфильтрованных навыков.

Репозиторий GitHub под названием awesome-openclaw-skills предлагает 1700+ готовых к использованию навыков, которые ИИ-агенты могут установить одной командой в CLI, отфильтрованных из официального реестра навыков OpenClaw.

OpenClawRadar
LoreConvo: Сервер MCP добавляет постоянную память сессий в код Claude
Инструменты

LoreConvo: Сервер MCP добавляет постоянную память сессий в код Claude

LoreConvo — это MCP-сервер, который предоставляет Claude Code постоянную память сессий, автоматически сохраняя и загружая контекст между сессиями. Он экономит 3 000–8 000 токенов за сессию, устраняя накладные расходы на повторное контекстуализирование.

OpenClawRadar
Sandbox0: Открытая инфраструктура песочницы на основе Kubernetes для ИИ-агентов
Инструменты

Sandbox0: Открытая инфраструктура песочницы на основе Kubernetes для ИИ-агентов

Sandbox0 — это инфраструктура песочницы с открытым исходным кодом для ИИ-агентов, построенная на Kubernetes с постоянным хранилищем через JuiceFS и автоматическим масштабированием. Она решает такие ограничения существующих решений, как лимиты на параллельное выполнение и эфемерное исполнение.

OpenClawRadar