Mesh LLM: Распределённые AI-вычисления на Iroh – Запуск LLM на ваших собственных GPU
Mesh LLM — это распределенная платформа для ИИ-вычислений, которая объединяет GPU и память нескольких машин и предоставляет всё как один API, совместимый с OpenAI, по адресу http://localhost:9337/v1. Вы можете запустить один узел, добавить другие позже, и позволить mesh решать, будет ли модель работать локально, маршрутизироваться к пиру, у которого она уже загружена, или распределяться по нескольким машинам.
Как это работает
Под капотом Mesh LLM использует конечные точки iroh для идентификации (открытый ключ) и сетевого взаимодействия. Центрального сервера нет. iroh обрабатывает обход NAT, hole-punching и резервную ретрансляцию через QUIC-соединения. Протокол определяет три ALPN:
mesh-llm/1— основная mesh (gossip, маршрутизация, HTTP-туннели, каналы плагинов)mesh-llm-control/1— плоскость управления владельца (синхронизация конфигурации, подтверждение владения)skippy-stage/2— чувствительный к задержкам транспорт активации для разделенных моделей
Внутри основного соединения вся связь мультиплексируется через двунаправленные QUIC-потоки, помеченные одним ведущим байтом:
0x01GOSSIP — объявления пиров (модели, GPU, RTT, возможности)0x04TUNNEL_HTTP — запросы инференса, проксируемые к пиру0x05ROUTE_REQUEST — запрос, какие модели хостит пир0x06PEER_DOWN — уведомление о неработающем пире0x07PEER_LEAVING — корректное завершение работы0x08PLUGIN_CHANNEL — RPC плагина0x0eDIRECT_PATH_REQUEST — обмен прямыми адресами для обхода NAT
Режим разделения ("Skippy")
Для моделей, слишком больших для одного GPU (например, 235B mixture-of-experts), Mesh LLM имеет режим разделения, который разбивает модель по диапазонам слоев на стадии. Слои 0–15 выполняются на одном узле, 16–31 — на следующем и так далее. Активации передаются от одной стадии к другой через QUIC-потоки. Несколько скромных машин вместе могут запустить модель, которую ни одна из них не смогла бы удержать в одиночку.
Модульная архитектура
Плагины объявляют свои возможности в манифесте. Среда выполнения запускает их, маршрутизирует вызовы и предоставляет их возможности через MCP, HTTP, инференс и события mesh. В каталоге поставляется 40+ моделей — от моделей с половиной миллиарда параметров, помещающихся на ноутбук, до гигантов на 235B.
Для кого это
Для команд, которые хотят контролировать собственную ИИ-инфраструктуру: делиться вычислительными мощностями GPU приватно или публично, запускать более крупные модели без покупки более мощного оборудования и избежать привязки к вендору. Любой клиент OpenAI может указать localhost:9337 и перестать заботиться о том, где на самом деле выполняется работа.
📖 Читать полный исходник: HN LLM Tools
👀 Смотрите также

Майк: Открытая юридическая ИИ-система с самостоятельным хостингом и поддержкой множества моделей
Mike — это открытая альтернатива Harvey и Legora, предлагающая чат с документами, табличное извлечение данных и шаблоны рабочих процессов — всё это можно разместить на собственном сервере, используя ключи API от Claude или Gemini.

Потрясающий репозиторий навыков OpenClaw предоставляет более 5400 отфильтрованных навыков.
Репозиторий GitHub под названием awesome-openclaw-skills предлагает 1700+ готовых к использованию навыков, которые ИИ-агенты могут установить одной командой в CLI, отфильтрованных из официального реестра навыков OpenClaw.

LoreConvo: Сервер MCP добавляет постоянную память сессий в код Claude
LoreConvo — это MCP-сервер, который предоставляет Claude Code постоянную память сессий, автоматически сохраняя и загружая контекст между сессиями. Он экономит 3 000–8 000 токенов за сессию, устраняя накладные расходы на повторное контекстуализирование.

Sandbox0: Открытая инфраструктура песочницы на основе Kubernetes для ИИ-агентов
Sandbox0 — это инфраструктура песочницы с открытым исходным кодом для ИИ-агентов, построенная на Kubernetes с постоянным хранилищем через JuiceFS и автоматическим масштабированием. Она решает такие ограничения существующих решений, как лимиты на параллельное выполнение и эфемерное исполнение.