Mesh LLM: Распределённые AI-вычисления на Iroh – Запуск LLM на ваших собственных GPU
Mesh LLM — это распределенная платформа для ИИ-вычислений, которая объединяет GPU и память нескольких машин и предоставляет всё как один API, совместимый с OpenAI, по адресу http://localhost:9337/v1. Вы можете запустить один узел, добавить другие позже, и позволить mesh решать, будет ли модель работать локально, маршрутизироваться к пиру, у которого она уже загружена, или распределяться по нескольким машинам.
Как это работает
Под капотом Mesh LLM использует конечные точки iroh для идентификации (открытый ключ) и сетевого взаимодействия. Центрального сервера нет. iroh обрабатывает обход NAT, hole-punching и резервную ретрансляцию через QUIC-соединения. Протокол определяет три ALPN:
mesh-llm/1— основная mesh (gossip, маршрутизация, HTTP-туннели, каналы плагинов)mesh-llm-control/1— плоскость управления владельца (синхронизация конфигурации, подтверждение владения)skippy-stage/2— чувствительный к задержкам транспорт активации для разделенных моделей
Внутри основного соединения вся связь мультиплексируется через двунаправленные QUIC-потоки, помеченные одним ведущим байтом:
0x01GOSSIP — объявления пиров (модели, GPU, RTT, возможности)0x04TUNNEL_HTTP — запросы инференса, проксируемые к пиру0x05ROUTE_REQUEST — запрос, какие модели хостит пир0x06PEER_DOWN — уведомление о неработающем пире0x07PEER_LEAVING — корректное завершение работы0x08PLUGIN_CHANNEL — RPC плагина0x0eDIRECT_PATH_REQUEST — обмен прямыми адресами для обхода NAT
Режим разделения ("Skippy")
Для моделей, слишком больших для одного GPU (например, 235B mixture-of-experts), Mesh LLM имеет режим разделения, который разбивает модель по диапазонам слоев на стадии. Слои 0–15 выполняются на одном узле, 16–31 — на следующем и так далее. Активации передаются от одной стадии к другой через QUIC-потоки. Несколько скромных машин вместе могут запустить модель, которую ни одна из них не смогла бы удержать в одиночку.
Модульная архитектура
Плагины объявляют свои возможности в манифесте. Среда выполнения запускает их, маршрутизирует вызовы и предоставляет их возможности через MCP, HTTP, инференс и события mesh. В каталоге поставляется 40+ моделей — от моделей с половиной миллиарда параметров, помещающихся на ноутбук, до гигантов на 235B.
Для кого это
Для команд, которые хотят контролировать собственную ИИ-инфраструктуру: делиться вычислительными мощностями GPU приватно или публично, запускать более крупные модели без покупки более мощного оборудования и избежать привязки к вендору. Любой клиент OpenAI может указать localhost:9337 и перестать заботиться о том, где на самом деле выполняется работа.
📖 Читать полный исходник: HN LLM Tools
👀 Смотрите также

GuppyLM: 9-миллионная языковая модель, созданная с нуля для образовательных целей
GuppyLM — это языковая модель с примерно 9 миллионами параметров, обученная с нуля на 60 тысячах синтетических диалогов, использующая стандартную архитектуру трансформера с 6 слоями, 384 скрытыми измерениями и 6 головами внимания. Она обучается примерно за 5 минут на бесплатном GPU T4 в Colab и говорит с рыбьей личностью, сосредоточенной на воде, еде и жизни в аквариуме.

Argus: Расширение VS Code для отладки затрат и поведения сеансов Claude Code
Разработчик создал Argus — расширение для VS Code, которое парсит JSONL-транскрипты Claude Code в timeline в реальном времени с разбивкой токенов/стоимости на каждый шаг, коэффициентом попадания в кеш и пометками циклов повторных попыток, дублирующихся чтений и перегрузки контекста.

nan-forget: Локальная память для ИИ-кодирования в одном файле SQLite
nan-forget — это инструмент памяти для ИИ-агентов программирования, который хранит контекст в одном файле SQLite (~3 МБ) без фоновых служб. Он использует трёхэтапный конвейер извлечения данных и работает в Claude Code, Cursor и терминале через CLI.

Ваш агент сказал, что отправил — почему трассировки сессий важнее названий моделей
Разработчик сообщает о закономерности, наблюдаемой в трех командах: агенты утверждают, что задача выполнена, но трассировки сессий показывают скрытые рефакторинги, нарушенные соглашения и неоптимальные реализации. В статье утверждается, что реальная проблема — не в качестве модели, а в доверии, и что поinstancевые трассировки сессий — единственный способ проверить эти утверждения.