NVIDIA DGX Sparkコミュニティ、再現可能なLLMベンチマークのためのSpark Arenaを立ち上げ

NVIDIA DGX Sparkコミュニティは、DGX Sparkハードウェア上でのオープンウェイト大規模言語モデルの再現可能なベンチマークプラットフォーム「Spark Arena」を確立し、従来の一貫性のないレポートの問題に対処しました。
背景と課題
NVIDIAは2025年10月中旬に、ローカルで大規模モデル(約200Bパラメータモデルの推論を含む)を実行可能な統一メモリを備えたデスクトップボックスとしてDGX Sparkの出荷を開始しました。コミュニティは「誰もが部分的な結果を投稿し、2週間後には誰も再現できなくなる」という繰り返し発生する問題を特定しました。
標準化された方法論
2025年10月14日、u/ggerganovはllama.cppにDGX Spark性能スレッドを投稿し、明確な方法論を提示しました:複数のコンテキスト深度とバッチサイズにわたるプリフィル(pp)と生成/デコード(tg)を測定し、llama.cpp CUDAビルドとllama-benchおよびllama-batched-benchを使用します。
コミュニティによる解決策
コミュニティは、ランタイムイメージ構築、オーケストレーション、レシピ形式のための標準化ツールに合意し、2026年2月11日にSpark Arenaを立ち上げました。
現在の性能リーダー
Spark Arenaからのトップデコードトークン/秒結果:
- gpt-oss-120b(vLLM、MXFP4、2ノード):75.96 tok/s
- Qwen3-Coder-Next(SGLang、FP8、2ノード):60.51 tok/s
- gpt-oss-120b(vLLM、MXFP4、シングルノード):58.82 tok/s
- NVIDIA-Nemotron-3-Nano-30B-A3B(vLLM、NVFP4、シングルノード):56.11 tok/s
実用的な意義
この標準化されたアプローチは、DGX Sparkハードウェア上でオープンウェイトLLMを選択・設定するための信頼性の高い性能データを開発者に提供し、モデルのデプロイメントと最適化に関するより情報に基づいた意思決定を可能にします。
📖 全文を読む: r/clawdbot
👀 See Also

CC 2.1.128 リリース:新しい内蔵バックグラウンドエージェント、C#ベータサポート、モデルの非推奨化
CC 2.1.128(+1406トークン)は組み込みのバックグラウンドエージェント指示、C#ツールランナー/マネージドエージェントのベータサポートを追加し、Sonnet 4とOpus 4を非推奨としてOpus 4.7/Sonnet 4.6を推奨し、セッションメモリテンプレートを削除します。

アンソピック社のクラウド、調査の代替として8万件の構造化インタビューを実施
Anthropicは、Claudeを使用して150カ国以上、70言語以上にわたる約80,000人のユーザーに対して構造化インタビューを実施する実験を行いました。LLMをインタビュアーとアナリストの両方として機能させ、会話形式のデータ収集アプローチを採用しました。

LeMario: スーパーマリオブラザーズでJEPA世界モデルを訓練する — 技術解説と事後検証
Benjamin Bai 氏が LeWorldModel の JEPA アーキテクチャをゼロから再現し、スーパーマリオブラザーズで学習。モデルは5ステップ先を予測できるが、長期的な計画は失敗——詳細な技術的検証レポート。

Claude Code 2.1.84は、汎用エージェントプロンプトとPowerShellツールを追加し、冗長なプロンプトを削除しました。
Claude Code 2.1.84では、コードベース操作のための汎用サブエージェントプロンプトと、スリープコマンド回避ガイドラインを含むPowerShellツールの説明が新たに追加されました。このアップデートでは、9つの冗長なプロンプトが削除され、複数のツール説明が簡素化されています。