Mesh LLM: Iroh上での分散AIコンピューティング – 自身のGPUでLLMを実行
Mesh LLMは、複数マシンにわたるGPUとメモリをプールし、全体をhttp://localhost:9337/v1でOpenAI互換の単一APIとして公開する分散AIコンピュートプラットフォームです。1つのノードから開始し、後からノードを追加でき、メッシュがモデルをローカルで実行するか、すでにロードしているピアにルーティングするか、複数マシンに分割するかを決定します。
仕組み
内部では、Mesh LLMはirohエンドポイントを使用してアイデンティティ(公開鍵)とネットワーキングを処理します。中央サーバーはありません。irohは、QUIC接続を介してNATトラバーサル、ホールパンチング、およびリレーフォールバックを処理します。プロトコルは3つのALPNを定義しています:
mesh-llm/1– メインメッシュ(ゴシップ、ルーティング、HTTPトンネル、プラグインチャネル)mesh-llm-control/1– オーナーコントロールプレーン(設定同期、所有権証明)skippy-stage/2– 分割モデルのレイテンシ重視のアクティベーショントランスポート
メイン接続内では、すべての通信は単一の先頭バイトでタグ付けされた双方向QUICストリーム上で多重化されます:
0x01GOSSIP – ピアアナウンス(モデル、GPU、RTT、機能)0x04TUNNEL_HTTP – ピアにプロキシされる推論リクエスト0x05ROUTE_REQUEST – ピアがホストするモデルの問い合わせ0x06PEER_DOWN – デッドピア通知0x07PEER_LEAVING – グレースフルシャットダウン0x08PLUGIN_CHANNEL – プラグインRPC0x0eDIRECT_PATH_REQUEST – NATトラバーサルのための直接アドレス共有
分割モード(「Skippy」)
単一のGPUには大きすぎるモデル(例:235B mixture-of-experts)に対して、Mesh LLMはモデルをレイヤー範囲でステージに分割する分割モードがあります。レイヤー0~15は1つのノード、16~31は次のノードといった具合です。アクティベーションはQUICストリームを介して次のステージに流れます。複数の小型マシンが協力して、単体では保持できないモデルを実行できます。
プラグイン可能なアーキテクチャ
プラグインはマニフェストでその機能を宣言します。ランタイムがプラグインを起動し、呼び出しをルーティングし、MCP、HTTP、推論、メッシュイベントを通じて機能を公開します。カタログには、ラップトップに収まる5億パラメータモデルから235Bの巨大モデルまで、40以上のモデルが収録されています。
対象ユーザー
自社のAIインフラを制御したいチーム:GPUコンピュートをプライベートまたはパブリックで共有し、より大きなハードウェアを購入せずに大規模モデルを実行し、ベンダーロックインを回避します。OpenAIクライアントはlocalhost:9337を指定するだけで、実際の処理場所を気にする必要はありません。
📖 ソース全文を読む: HN LLM Tools
👀 See Also

効率的なトークン管理をオープンソースMCPサーバーで実現:Pare
Pare MCPサーバーは、AIコーディングエージェントが開発者ツールを使用する際のトークン浪費を削減し、効率を向上させるために構造化された出力を提供します。

クロード・スルース:Claude AIのための56タスク調査ワークフロー
Claude Sleuthは、Claude AI向けの構造化された調査ワークフローで、6つのフェーズと56のタスクを備え、Cloudflare D1による永続的な状態保存と、ISO 8601タイムスタンプ、POLEエンティティレコード、ICD 203確率表現を含む標準化された出力規約を特徴としています。

DreamScape:Claude CodeとMCPを搭載したブラウザベース3Dワールドビルダー
DreamScapeは、Claude Codeが30個のMCPツールを制御して、自然言語コマンドでリアルタイムに地形、モデル、天候、行動を生成するブラウザベースの3Dワールドビルダーです。

海岸線:複数のローカルホスト環境を実行するためのコンテナ化ホスト
Coastsは、複数のlocalhost環境を同時に実行する問題を解決するDocker-in-Dockerソリューションです。複雑なスクリプトを必要とせず、ポート競合、シークレット、ボリュームトポロジーを処理します。