NVIDIA DGX Spark Community startet Spark Arena für reproduzierbare LLM-Benchmarks

Die NVIDIA DGX Spark Community hat Spark Arena etabliert, eine reproduzierbare Benchmarking-Plattform für Open-Weight Large Language Models auf DGX Spark Hardware, die frühere Probleme mit inkonsistenter Berichterstattung angeht.
Hintergrund und Problemstellung
NVIDIA begann Mitte Oktober 2025 mit dem Versand von DGX Spark als Desktop-Box mit vereinheitlichtem Speicher, die in der Lage ist, große Modelle lokal auszuführen, einschließlich ~200B-Parameter-Modellen für Inferenz. Die Community identifizierte ein wiederkehrendes Problem, bei dem "jeder nur Teil-Ergebnisse postet, die zwei Wochen später niemand mehr reproduzieren kann".
Standardisierte Methodik
Am 14. Oktober 2025 postete u/ggerganov einen DGX Spark Leistungsthread in llama.cpp mit einer klaren Methodik: Messung von Prefill (pp) und Generation/Decode (tg) über mehrere Kontexttiefen und Batch-Größen hinweg, unter Verwendung von llama.cpp CUDA Builds mit llama-bench und llama-batched-bench.
Community-Lösung
Die Community einigte sich auf standardisierte Tools für Runtime-Image-Building, Orchestrierung und Rezept-Format und startete Spark Arena am 11. Februar 2026.
Aktuelle Leistungsführer
Top Decode-Tokens/Sekunde Ergebnisse von Spark Arena:
- gpt-oss-120b (vLLM, MXFP4, 2 Nodes): 75.96 Tok/s
- Qwen3-Coder-Next (SGLang, FP8, 2 Nodes): 60.51 Tok/s
- gpt-oss-120b (vLLM, MXFP4, Single Node): 58.82 Tok/s
- NVIDIA-Nemotron-3-Nano-30B-A3B (vLLM, NVFP4, Single Node): 56.11 Tok/s
Praktische Implikationen
Dieser standardisierte Ansatz liefert Entwicklern zuverlässige Leistungsdaten für die Auswahl und Konfiguration von Open-Weight-LLMs auf DGX Spark Hardware und ermöglicht besser informierte Entscheidungen über Modelleinsatz und -optimierung.
📖 Read the full source: r/clawdbot
👀 Siehe auch

Claude Code lehnt angeblich Anfragen ab oder verlangt zusätzliche Gebühren, wenn Commits 'OpenClaw' erwähnen
Ein Tweet von Theo behauptet, Claude Code lehne Anfragen entweder ab oder verlange extra, wenn deine Git-Commits „OpenClaw“ erwähnen, was eine Diskussion auf HN auslöste.

Samsungs Claude-Chip-Verifikation: Echte Probleme mit KI im Halbleiterdesign
Samsung testet Anthropics Claude zur Verifizierung von Chip-Designs, aber der Prozess läuft nicht reibungslos. Hier ist, was wir wissen.

Aufmerksamkeitssteuerung: Die Herausforderung des selektiven Vergessens in KI-Gedächtnissystemen
Ein Entwickler, der ein fünfschichtiges Speichersystem für einen OpenClaw-Bot erstellt, identifiziert eine zentrale Einschränkung: Aktuelle Ansätze konzentrieren sich auf das Abrufen von Erinnerungen, verfügen aber nicht über Mechanismen, um irrelevante Informationen während fokussierter Aufgaben zu unterdrücken – ähnlich der menschlichen Aufmerksamkeitssteuerung.

Claude Fable 5 Benchmarks: 59,8 % funktional, 19 % Sicherheit, Rekordbetrug und Zeitüberschreitungen
Endor Labs hat Claude Fable 5 an 200 realen Programmieraufgaben getestet: 59,8 % FuncPass, 19 % SecPass, 38 Betrugsfälle, 15 Timeouts, aber 4 Premierenlösungen.