NVIDIA DGX Spark Community startet Spark Arena für reproduzierbare LLM-Benchmarks

Die NVIDIA DGX Spark Community hat Spark Arena etabliert, eine reproduzierbare Benchmarking-Plattform für Open-Weight Large Language Models auf DGX Spark Hardware, die frühere Probleme mit inkonsistenter Berichterstattung angeht.
Hintergrund und Problemstellung
NVIDIA begann Mitte Oktober 2025 mit dem Versand von DGX Spark als Desktop-Box mit vereinheitlichtem Speicher, die in der Lage ist, große Modelle lokal auszuführen, einschließlich ~200B-Parameter-Modellen für Inferenz. Die Community identifizierte ein wiederkehrendes Problem, bei dem "jeder nur Teil-Ergebnisse postet, die zwei Wochen später niemand mehr reproduzieren kann".
Standardisierte Methodik
Am 14. Oktober 2025 postete u/ggerganov einen DGX Spark Leistungsthread in llama.cpp mit einer klaren Methodik: Messung von Prefill (pp) und Generation/Decode (tg) über mehrere Kontexttiefen und Batch-Größen hinweg, unter Verwendung von llama.cpp CUDA Builds mit llama-bench und llama-batched-bench.
Community-Lösung
Die Community einigte sich auf standardisierte Tools für Runtime-Image-Building, Orchestrierung und Rezept-Format und startete Spark Arena am 11. Februar 2026.
Aktuelle Leistungsführer
Top Decode-Tokens/Sekunde Ergebnisse von Spark Arena:
- gpt-oss-120b (vLLM, MXFP4, 2 Nodes): 75.96 Tok/s
- Qwen3-Coder-Next (SGLang, FP8, 2 Nodes): 60.51 Tok/s
- gpt-oss-120b (vLLM, MXFP4, Single Node): 58.82 Tok/s
- NVIDIA-Nemotron-3-Nano-30B-A3B (vLLM, NVFP4, Single Node): 56.11 Tok/s
Praktische Implikationen
Dieser standardisierte Ansatz liefert Entwicklern zuverlässige Leistungsdaten für die Auswahl und Konfiguration von Open-Weight-LLMs auf DGX Spark Hardware und ermöglicht besser informierte Entscheidungen über Modelleinsatz und -optimierung.
📖 Read the full source: r/clawdbot
👀 Siehe auch

Claude Code v2.1.91 Updates: Agent-Design-Patterns, Speicherregeln und Tool-Verbesserungen
Claude Code v2.1.91 fügt einen Referenzleitfaden für Agent-Design-Patterns hinzu, der die Gestaltung von Werkzeugschnittstellen, Kontextmanagement und Caching-Strategien abdeckt. Das Update vereinfacht die Regeln für die Speicherauswahl, fügt Sicherheitsüberwachung für Memory Poisoning hinzu und verbessert die Werkzeugbeschreibungen für Edit-, ReadFile- und Write-Operationen.

Greg Kroah-Hartmans Clanker T1000: Lokales LLM auf Framework Desktop mit AMD Ryzen AI Max, das Linux-Kernel-Bug fuzzt
Greg KH's 'gregkh_clanker_t1000' verwendet ein lokales LLM, das auf einem Framework Desktop (AMD Ryzen AI Max+) läuft, um den Linux-Kernel zu fuzzen, was zu ~20 zusammengeführten Patches seit dem 7. April führte, die Fehler in ALSA, HID, SMB, Nouveau, IO_uring und mehr beheben.

Xiaomi veröffentlicht MiMo-V2.5-Pro als Open Source: Nähert sich Claude Opus 4.6 bei Programmier-Benchmarks
Xiaomi hat MiMo-V2.5-Pro veröffentlicht, ein Open-Source-Coding-Modell, das bei einem Universitäts-Compiler-Projekt 233/233 Punkte erzielte, eigenständig einen Videoeditor entwickelte und auf SWE-Bench und Terminal-Bench innerhalb der besten 1% von Claude Opus 4.6 liegt.

Nvidia entwickelt angeblich das Open-Source-Tool NemoClaw, um mit OpenClaw zu konkurrieren.
Aktuelle Berichte deuten darauf hin, dass Nvidia an einem Open-Source-Projekt namens NemoClaw arbeitet, das direkt mit OpenClaw bei KI-Entwicklungstools konkurrieren soll. Das Projekt soll sich voraussichtlich auf die Verbesserung von Leistung, Skalierbarkeit und Entwicklerflexibilität konzentrieren, während die Kompatibilität mit modernen KI-Workflows erhalten bleibt.