Mesh LLM: Распределённые AI-вычисления на Iroh – Запуск LLM на ваших собственных GPU

✍️ OpenClawRadar📅 Опубликовано: 12 июля 2026 г.🔗 Source
Ad

Mesh LLM — это распределенная платформа для ИИ-вычислений, которая объединяет GPU и память нескольких машин и предоставляет всё как один API, совместимый с OpenAI, по адресу http://localhost:9337/v1. Вы можете запустить один узел, добавить другие позже, и позволить mesh решать, будет ли модель работать локально, маршрутизироваться к пиру, у которого она уже загружена, или распределяться по нескольким машинам.

Как это работает

Под капотом Mesh LLM использует конечные точки iroh для идентификации (открытый ключ) и сетевого взаимодействия. Центрального сервера нет. iroh обрабатывает обход NAT, hole-punching и резервную ретрансляцию через QUIC-соединения. Протокол определяет три ALPN:

  • mesh-llm/1 — основная mesh (gossip, маршрутизация, HTTP-туннели, каналы плагинов)
  • mesh-llm-control/1 — плоскость управления владельца (синхронизация конфигурации, подтверждение владения)
  • skippy-stage/2 — чувствительный к задержкам транспорт активации для разделенных моделей

Внутри основного соединения вся связь мультиплексируется через двунаправленные QUIC-потоки, помеченные одним ведущим байтом:

  • 0x01 GOSSIP — объявления пиров (модели, GPU, RTT, возможности)
  • 0x04 TUNNEL_HTTP — запросы инференса, проксируемые к пиру
  • 0x05 ROUTE_REQUEST — запрос, какие модели хостит пир
  • 0x06 PEER_DOWN — уведомление о неработающем пире
  • 0x07 PEER_LEAVING — корректное завершение работы
  • 0x08 PLUGIN_CHANNEL — RPC плагина
  • 0x0e DIRECT_PATH_REQUEST — обмен прямыми адресами для обхода NAT
Ad

Режим разделения ("Skippy")

Для моделей, слишком больших для одного GPU (например, 235B mixture-of-experts), Mesh LLM имеет режим разделения, который разбивает модель по диапазонам слоев на стадии. Слои 0–15 выполняются на одном узле, 16–31 — на следующем и так далее. Активации передаются от одной стадии к другой через QUIC-потоки. Несколько скромных машин вместе могут запустить модель, которую ни одна из них не смогла бы удержать в одиночку.

Модульная архитектура

Плагины объявляют свои возможности в манифесте. Среда выполнения запускает их, маршрутизирует вызовы и предоставляет их возможности через MCP, HTTP, инференс и события mesh. В каталоге поставляется 40+ моделей — от моделей с половиной миллиарда параметров, помещающихся на ноутбук, до гигантов на 235B.

Для кого это

Для команд, которые хотят контролировать собственную ИИ-инфраструктуру: делиться вычислительными мощностями GPU приватно или публично, запускать более крупные модели без покупки более мощного оборудования и избежать привязки к вендору. Любой клиент OpenAI может указать localhost:9337 и перестать заботиться о том, где на самом деле выполняется работа.

📖 Читать полный исходник: HN LLM Tools

Ad

👀 Смотрите также

GuppyLM: 9-миллионная языковая модель, созданная с нуля для образовательных целей
Инструменты

GuppyLM: 9-миллионная языковая модель, созданная с нуля для образовательных целей

GuppyLM — это языковая модель с примерно 9 миллионами параметров, обученная с нуля на 60 тысячах синтетических диалогов, использующая стандартную архитектуру трансформера с 6 слоями, 384 скрытыми измерениями и 6 головами внимания. Она обучается примерно за 5 минут на бесплатном GPU T4 в Colab и говорит с рыбьей личностью, сосредоточенной на воде, еде и жизни в аквариуме.

OpenClawRadar
Argus: Расширение VS Code для отладки затрат и поведения сеансов Claude Code
Инструменты

Argus: Расширение VS Code для отладки затрат и поведения сеансов Claude Code

Разработчик создал Argus — расширение для VS Code, которое парсит JSONL-транскрипты Claude Code в timeline в реальном времени с разбивкой токенов/стоимости на каждый шаг, коэффициентом попадания в кеш и пометками циклов повторных попыток, дублирующихся чтений и перегрузки контекста.

OpenClawRadar
nan-forget: Локальная память для ИИ-кодирования в одном файле SQLite
Инструменты

nan-forget: Локальная память для ИИ-кодирования в одном файле SQLite

nan-forget — это инструмент памяти для ИИ-агентов программирования, который хранит контекст в одном файле SQLite (~3 МБ) без фоновых служб. Он использует трёхэтапный конвейер извлечения данных и работает в Claude Code, Cursor и терминале через CLI.

OpenClawRadar
Ваш агент сказал, что отправил — почему трассировки сессий важнее названий моделей
Инструменты

Ваш агент сказал, что отправил — почему трассировки сессий важнее названий моделей

Разработчик сообщает о закономерности, наблюдаемой в трех командах: агенты утверждают, что задача выполнена, но трассировки сессий показывают скрытые рефакторинги, нарушенные соглашения и неоптимальные реализации. В статье утверждается, что реальная проблема — не в качестве модели, а в доверии, и что поinstancевые трассировки сессий — единственный способ проверить эти утверждения.

OpenClawRadar