NVIDIA DGX Spark Community lanza Spark Arena para benchmarks reproducibles de LLM.

La comunidad NVIDIA DGX Spark ha establecido Spark Arena, una plataforma de evaluación reproducible para modelos de lenguaje grandes de pesos abiertos en hardware DGX Spark, abordando problemas anteriores con informes inconsistentes.
Antecedentes y Problema
NVIDIA comenzó a enviar DGX Spark a mediados de octubre de 2025 como una caja de escritorio con memoria unificada capaz de ejecutar modelos grandes localmente, incluidos modelos de ~200B parámetros para inferencia. La comunidad identificó un problema recurrente donde "todos publican resultados parciales, y luego nadie puede reproducirlos dos semanas después".
Metodología Estandarizada
El 14 de octubre de 2025, u/ggerganov publicó un hilo de rendimiento de DGX Spark en llama.cpp con una metodología clara: medir prellenado (pp) y generación/decoficación (tg) en múltiples profundidades de contexto y tamaños de lote, utilizando compilaciones CUDA de llama.cpp con llama-bench y llama-batched-bench.
Solución Comunitaria
La comunidad acordó herramientas estandarizadas para la construcción de imágenes de tiempo de ejecución, orquestación y formato de recetas, lanzando Spark Arena el 11 de febrero de 2026.
Líderes Actuales de Rendimiento
Principales resultados de tokens/seg de decodificación de Spark Arena:
- gpt-oss-120b (vLLM, MXFP4, 2 nodos): 75.96 tok/s
- Qwen3-Coder-Next (SGLang, FP8, 2 nodos): 60.51 tok/s
- gpt-oss-120b (vLLM, MXFP4, nodo único): 58.82 tok/s
- NVIDIA-Nemotron-3-Nano-30B-A3B (vLLM, NVFP4, nodo único): 56.11 tok/s
Implicaciones Prácticas
Este enfoque estandarizado proporciona a los desarrolladores datos de rendimiento confiables para seleccionar y configurar LLM de pesos abiertos en hardware DGX Spark, permitiendo decisiones mejor informadas sobre implementación y optimización de modelos.
📖 Read the full source: r/clawdbot
👀 Ver también

Fundador de OpenClaw, Peter Steinberger: Multijugador en la nube, servidores de equipo y colaboración agente a agente en el episodio 7 de The ClawCast
En el Episodio 7 de The ClawCast, el fundador de OpenClaw, Peter Steinberger, responde preguntas de la comunidad sobre flujos de trabajo multijugador en la nube, servidores de equipo, colaboración agente a agente, memoria y enrutamiento de modelos.

Nemotron 3 4B rinde menos que Qwen 3.5 4B en puntos de referencia exigentes.
Un usuario de Reddit probó Nemotron 3 4B Q8 contra Qwen 3.5 4B Q8 en tareas complejas de matemáticas y programación, encontrando que Nemotron no logró producir razonamientos correctos y salidas estructuradas, mientras que Qwen pasó todas las pruebas.

ICML 2026 rechaza el 2% de los artículos por violaciones a la política de revisión con LLM.
ICML 2026 rechazó 497 artículos (~2% de los envíos) después de detectar 795 revisiones (~1% de todas las revisiones) donde los revisores violaron acuerdos explícitos de no usar LLM. El método de detección implicó marcar con filigrana los PDF con instrucciones ocultas para LLM.

Título del artículo: Código Abierto vs Modelos Frontera: Benchmark de Escena de Coche en Lienzo de Archivo Único
Un desarrollador probó 12 modelos, incluidos GPT-5.5, Claude Opus 4.7 y Qwen 3.6 Plus, en una tarea de animación de un coche conduciendo en un lienzo HTML de un solo archivo, con resultados comparados públicamente.