Mesh LLM: Iroh上での分散AIコンピューティング – 自身のGPUでLLMを実行
Mesh LLMは、複数マシンにわたるGPUとメモリをプールし、全体をhttp://localhost:9337/v1でOpenAI互換の単一APIとして公開する分散AIコンピュートプラットフォームです。1つのノードから開始し、後からノードを追加でき、メッシュがモデルをローカルで実行するか、すでにロードしているピアにルーティングするか、複数マシンに分割するかを決定します。
仕組み
内部では、Mesh LLMはirohエンドポイントを使用してアイデンティティ(公開鍵)とネットワーキングを処理します。中央サーバーはありません。irohは、QUIC接続を介してNATトラバーサル、ホールパンチング、およびリレーフォールバックを処理します。プロトコルは3つのALPNを定義しています:
mesh-llm/1– メインメッシュ(ゴシップ、ルーティング、HTTPトンネル、プラグインチャネル)mesh-llm-control/1– オーナーコントロールプレーン(設定同期、所有権証明)skippy-stage/2– 分割モデルのレイテンシ重視のアクティベーショントランスポート
メイン接続内では、すべての通信は単一の先頭バイトでタグ付けされた双方向QUICストリーム上で多重化されます:
0x01GOSSIP – ピアアナウンス(モデル、GPU、RTT、機能)0x04TUNNEL_HTTP – ピアにプロキシされる推論リクエスト0x05ROUTE_REQUEST – ピアがホストするモデルの問い合わせ0x06PEER_DOWN – デッドピア通知0x07PEER_LEAVING – グレースフルシャットダウン0x08PLUGIN_CHANNEL – プラグインRPC0x0eDIRECT_PATH_REQUEST – NATトラバーサルのための直接アドレス共有
分割モード(「Skippy」)
単一のGPUには大きすぎるモデル(例:235B mixture-of-experts)に対して、Mesh LLMはモデルをレイヤー範囲でステージに分割する分割モードがあります。レイヤー0~15は1つのノード、16~31は次のノードといった具合です。アクティベーションはQUICストリームを介して次のステージに流れます。複数の小型マシンが協力して、単体では保持できないモデルを実行できます。
プラグイン可能なアーキテクチャ
プラグインはマニフェストでその機能を宣言します。ランタイムがプラグインを起動し、呼び出しをルーティングし、MCP、HTTP、推論、メッシュイベントを通じて機能を公開します。カタログには、ラップトップに収まる5億パラメータモデルから235Bの巨大モデルまで、40以上のモデルが収録されています。
対象ユーザー
自社のAIインフラを制御したいチーム:GPUコンピュートをプライベートまたはパブリックで共有し、より大きなハードウェアを購入せずに大規模モデルを実行し、ベンダーロックインを回避します。OpenAIクライアントはlocalhost:9337を指定するだけで、実際の処理場所を気にする必要はありません。
📖 ソース全文を読む: HN LLM Tools
👀 See Also

Docent: Claude Codeで構築された論文分析AIアシスタント
開発者が、Claude Codeを使用してアップロードされた論文を読み、提示し、質問に答え、理解度を評価するAIアシスタント「Docent」を作成しました。このプロジェクトはMITライセンスの下でGitHubで公開されており、Vercelでデモが利用可能です。

Claude Code v2.1.59では、自動メモリ機能、コピーコマンド、およびシェルの改善が追加されました。
Claude Code v2.1.59では、/memory管理による自動メモリへの自動コンテキスト保存、インタラクティブなコードブロック選択のための/copyコマンドの追加、複合bashコマンドのプレフィックス提案の改善が導入されました。

クロードワークフローにおけるハンドオフパターン:2ファイル分割方式と1ドキュメント要約方式
長いClaudeセッションはコンテキスト劣化で壊れます。ハンドオフは重要な情報を圧縮して新しいエージェントを起動します。Matt Pocockのシングルドキュメントハンドオフスキルと、永続的なナラティブと一時的なプロンプトを使う2ファイル分割の2つのアプローチがあります。

Xrouterの紹介:コストとパフォーマンスを最適化するスマートハイブリッドLLMルーター
Xrouterは、ローカルとクラウドの推論を動的に統合するオープンソースの創造物で、AIコストを削減しながら効率を向上させるように設計されています。