NVIDIA Groq 3 LPXが長文コンテキストベンチマークで毎秒3,431トークンを達成
NVIDIAのGroq 3 LPXは、Vera Rubinプラットフォーム向けのインタラクティブ推論アクセラレータで、初のサードパーティベンチマーク結果を発表しました。Gemma 4 31Bモデルを使用したArtificial Analysisの100Kコンテキストベンチマークで、毎秒3,431出力トークンを記録しました。この結果は、「高インタラクティブ」なサービング層を対象としており、コンテキストが数十万トークンに成長するマルチターンのエージェントセッションに必要な応答性を実現します。
長いコンテキストとインタラクティブ性が難しい理由
エージェントワークロードはマルチターンです。各ターンで出力がコンテキストに追加され、後続のターンではそれまでのすべてを再処理する必要があります。100K以上の入力トークンで、大きなKVキャッシュを管理しながらユーザーあたり毎秒3,000トークン以上の速度でサービスを提供することは、システム上の課題です。標準的な手法であるテンソル並列処理(TP)は計算をチップ間で分割しますが、インタラクティブな遅延に必要な非常に小さなバッチサイズでは、調整(集団通信)の固定コストが高速化の効果を打ち消す可能性があります。
ボトルネックは帯域幅ではなく、最初のビットのレイテンシです。記事にあるように、小さなテンソルでは転送時間はデータ量(N)を帯域幅(B)で割ったものではなく、レイテンシ(A)によって支配されます。
Groq 3 LPXのアプローチ
Groq 3 LPXは、決定的でコンパイラがスケジュールするワークロード計画によってこれを解決します。コンパイラは各テンソルの送受信タイミングを事前にスケジュールし、計算と通信を細かい粒度でオーバーラップさせます。事前に計画されたチップ間ネットワーキングは最初のビットのレイテンシを最小化し、バッチサイズ1でもTPを効果的にします。
エージェントおよびコーディング固有のタスクを測定するSPEED-Benchでは、Groq 3 LPXは中央値で毎秒4,767出力トークンを達成しました。このシステムはVera Rubin NVL72で複数のデプロイ構成をサポートしています:
- プリフィル・デコード分離
- アテンション・FFN分離
- 投機的外部ドラフターによるデコーディング
これらは数兆パラメータのモデルにスケール可能で、Groq 3 LPXのインタラクティブ性とVera Rubinのスループットを組み合わせて、大規模AIファクトリ向けに提供します。
対象読者
長いコンテキストで高いインタラクティブ性を要求するエージェントシステムを構築する開発者、特に2T以上のパラメータモデルでマルチエージェントワークフローを実行している開発者は、このベンチマークがインフラ計画に役立つでしょう。
📖 全文はこちら: HN AI Agents
👀 See Also

LLMの失敗パターンとADHD認知の間にある、研究に裏付けられた6つの類似点
ADHDを持つ開発者が、連想処理、虚偽記憶、作業記憶の制限、パターン補完、構造依存性、スレッド継続性に関する独立した研究に基づき、LLMの失敗パターンとADHDの認知科学との間に6つの類似点を指摘しています。

UberのAI開発、34億ドルの投資にもかかわらず予算制約に直面
UberのAIへの取り組みは、同社のCTOによると、34億ドルをこれらの取り組みに割り当てているにもかかわらず、予算の制限に直面しています。この記事は、財政的制約の中でAI開発を拡大することの課題について論じています。

RustがAIからLinuxを救う:グレッグ・クロー=ハートマン氏、C言語のバグとRustの安全性保証について
Linux安定版カーネルメンテナーのGreg Kroah-Hartman氏は、Rustがコンパイル時にカーネルバグの60%を排除し、Dirty FragやFragnesiaなどのAI発見のCVEへの対応策となると述べています。

OpenRouterのHealer Alphaステルスモデルは、未公開のQwen 3.5-Omniバリアントである可能性があります。
OpenRouterは、262,144トークンのコンテキストウィンドウとマルチモーダル機能を備えた無料の匿名オムニモーダルモデル「Healer Alpha」を導入しました。フォレンジック分析によると、これはAlibabaの未公開のQwen 3.5-Omniバリアントである可能性が示唆されています。