Homa: AIクラスタネットワーキングのためのTCP代替

✍️ OpenClawRadar📅 公開日: October 5, 2026🔗 Source
Ad

Homaは、データセンターやAIクラスタネットワークにおいてTCPを置き換えるために設計されたトランスポートプロトコルです。そこでは、マイクロ秒スケールのテールレイテンシがバイトストリームのセマンティクスよりも重要になります。この動画では、その設計と動機を解説します。

HomaがTCPと異なる点

TCPは広域インターネット向けに作られており、長期間存続するフロー間での帯域幅と公平性を最適化します。Homaは受信者駆動型です。送信者が容量を探る代わりに、受信者が送信者にクレジットを付与し、SRPT(最短残り処理時間優先)を用いて受信メッセージをスケジュールします。短いメッセージ——AIトレーニングにおけるRPCや集団操作で一般的なケース——は、大きなバルク転送よりも優先されます。

これがAIクラスタにとって重要な理由

AIトレーニングと推論のトラフィックはバースト的でメッセージ指向です。AllReduce、パラメータサーバー更新、KVキャッシュ転送はすべて、少数の長いバイトストリームではなく、多数の小さなメッセージのように見えます。TCPのフローごとの輻輳制御と順序通りのバイト配信は、ヘッドオブラインブロッキングとキュイング遅延を追加し、大規模でのジョブ完了時間を悪化させます。

Ousterhoutらによる元のUSENIX ATC '21論文が中核的な参考文献です。これは、データセンターのワークロード下でTCPベースのスタックと比較して、99パーセンタイルのメッセージレイテンシが桁違いに削減されること、および多数の短いメッセージがファブリックを共有する場合のスループット向上を報告しています。

現在の状況

リンクされたLWNの記事は、HomaのようなスケジューリングをLinuxネットワークスタックに導入する進行中の取り組みを扱っています——TCPを拡張するか、新しいトランスポートを追加するか、カーネルモジュールとして構築するかについての長期にわたる議論です。The Registerの記事は、スタンフォードプロジェクトの観点を扱っています。

GPUクラスタを構築または運用していて、ジョブ完了時間がコンピュートではなくネットワークのテールレイテンシに支配されているなら、これは追跡する価値があります。論文は設計を理解する最速の方法であり、LWNスレッドはカーネル統合が実際にどのようになるかを示しています。

📖 Read the full source: HN LLM Tools

Ad

👀 See Also

ヤン・ルカンのAMI、AI世界モデルに10億ドル調達、LLMアプローチに挑戦
News

ヤン・ルカンのAMI、AI世界モデルに10億ドル調達、LLMアプローチに挑戦

ヤン・ルカン氏のスタートアップAMIは、物理世界を理解するAI世界モデルを開発するため、10億ドル以上を調達した。同氏は、LLMだけでは人間レベルの知能は達成できないと主張している。同社は製造、バイオメディカル、ロボティクス分野向けに、持続的メモリ、推論、計画能力を備えたシステムを構築する。

OpenClawRadar
GoogleアカウントがOpenClaw統合試行後に停止されました
News

GoogleアカウントがOpenClaw統合試行後に停止されました

開発者がOpenClaw統合のためにAPIアクセスを設定した後、わずか48時間で新規Googleアカウントが停止されました。手動で作成されたにもかかわらず、ボット活動としてフラグが立てられました。

OpenClawRadar
Mistral Medium 3.5 128B リリース: 構成可能な推論と視覚機能を備えた高密度モデル
News

Mistral Medium 3.5 128B リリース: 構成可能な推論と視覚機能を備えた高密度モデル

Mistral AIは、128Bの高密度モデルであるMistral Medium 3.5をリリースしました。256kのコンテキスト、設定可能な推論努力、ビジョン機能を備え、修正MITライセンスの下で提供されます。

OpenClawRadar
最新AIモデルのベンチマーキング:極端モデルの台頭
News

最新AIモデルのベンチマーキング:極端モデルの台頭

40の新AIモデルを詳細にベンチマークした結果、市場は『ゴッドモード』と『フラッシュモード』が主導する二極化が明らかになりました。中級モデルは現在、時代遅れと見なされています。

OpenClawRadar