NVIDIA Groq 3 LPXが長文コンテキストベンチマークで毎秒3,431トークンを達成

✍️ OpenClawRadar📅 公開日: August 25, 2026🔗 Source
Ad

NVIDIAのGroq 3 LPXは、Vera Rubinプラットフォーム向けのインタラクティブ推論アクセラレータで、初のサードパーティベンチマーク結果を発表しました。Gemma 4 31Bモデルを使用したArtificial Analysisの100Kコンテキストベンチマークで、毎秒3,431出力トークンを記録しました。この結果は、「高インタラクティブ」なサービング層を対象としており、コンテキストが数十万トークンに成長するマルチターンのエージェントセッションに必要な応答性を実現します。

長いコンテキストとインタラクティブ性が難しい理由

エージェントワークロードはマルチターンです。各ターンで出力がコンテキストに追加され、後続のターンではそれまでのすべてを再処理する必要があります。100K以上の入力トークンで、大きなKVキャッシュを管理しながらユーザーあたり毎秒3,000トークン以上の速度でサービスを提供することは、システム上の課題です。標準的な手法であるテンソル並列処理(TP)は計算をチップ間で分割しますが、インタラクティブな遅延に必要な非常に小さなバッチサイズでは、調整(集団通信)の固定コストが高速化の効果を打ち消す可能性があります。

ボトルネックは帯域幅ではなく、最初のビットのレイテンシです。記事にあるように、小さなテンソルでは転送時間はデータ量(N)を帯域幅(B)で割ったものではなく、レイテンシ(A)によって支配されます。

Ad

Groq 3 LPXのアプローチ

Groq 3 LPXは、決定的でコンパイラがスケジュールするワークロード計画によってこれを解決します。コンパイラは各テンソルの送受信タイミングを事前にスケジュールし、計算と通信を細かい粒度でオーバーラップさせます。事前に計画されたチップ間ネットワーキングは最初のビットのレイテンシを最小化し、バッチサイズ1でもTPを効果的にします。

エージェントおよびコーディング固有のタスクを測定するSPEED-Benchでは、Groq 3 LPXは中央値で毎秒4,767出力トークンを達成しました。このシステムはVera Rubin NVL72で複数のデプロイ構成をサポートしています:

  • プリフィル・デコード分離
  • アテンション・FFN分離
  • 投機的外部ドラフターによるデコーディング

これらは数兆パラメータのモデルにスケール可能で、Groq 3 LPXのインタラクティブ性とVera Rubinのスループットを組み合わせて、大規模AIファクトリ向けに提供します。

対象読者

長いコンテキストで高いインタラクティブ性を要求するエージェントシステムを構築する開発者、特に2T以上のパラメータモデルでマルチエージェントワークフローを実行している開発者は、このベンチマークがインフラ計画に役立つでしょう。

📖 全文はこちら: HN AI Agents

Ad

👀 See Also

LLMの失敗パターンとADHD認知の間にある、研究に裏付けられた6つの類似点
News

LLMの失敗パターンとADHD認知の間にある、研究に裏付けられた6つの類似点

ADHDを持つ開発者が、連想処理、虚偽記憶、作業記憶の制限、パターン補完、構造依存性、スレッド継続性に関する独立した研究に基づき、LLMの失敗パターンとADHDの認知科学との間に6つの類似点を指摘しています。

OpenClawRadar
UberのAI開発、34億ドルの投資にもかかわらず予算制約に直面
News

UberのAI開発、34億ドルの投資にもかかわらず予算制約に直面

UberのAIへの取り組みは、同社のCTOによると、34億ドルをこれらの取り組みに割り当てているにもかかわらず、予算の制限に直面しています。この記事は、財政的制約の中でAI開発を拡大することの課題について論じています。

OpenClawRadar
RustがAIからLinuxを救う:グレッグ・クロー=ハートマン氏、C言語のバグとRustの安全性保証について
News

RustがAIからLinuxを救う:グレッグ・クロー=ハートマン氏、C言語のバグとRustの安全性保証について

Linux安定版カーネルメンテナーのGreg Kroah-Hartman氏は、Rustがコンパイル時にカーネルバグの60%を排除し、Dirty FragやFragnesiaなどのAI発見のCVEへの対応策となると述べています。

OpenClawRadar
OpenRouterのHealer Alphaステルスモデルは、未公開のQwen 3.5-Omniバリアントである可能性があります。
News

OpenRouterのHealer Alphaステルスモデルは、未公開のQwen 3.5-Omniバリアントである可能性があります。

OpenRouterは、262,144トークンのコンテキストウィンドウとマルチモーダル機能を備えた無料の匿名オムニモーダルモデル「Healer Alpha」を導入しました。フォレンジック分析によると、これはAlibabaの未公開のQwen 3.5-Omniバリアントである可能性が示唆されています。

OpenClawRadar