NVIDIA DGX Spark Community lanza Spark Arena para benchmarks reproducibles de LLM.

La comunidad NVIDIA DGX Spark ha establecido Spark Arena, una plataforma de evaluación reproducible para modelos de lenguaje grandes de pesos abiertos en hardware DGX Spark, abordando problemas anteriores con informes inconsistentes.
Antecedentes y Problema
NVIDIA comenzó a enviar DGX Spark a mediados de octubre de 2025 como una caja de escritorio con memoria unificada capaz de ejecutar modelos grandes localmente, incluidos modelos de ~200B parámetros para inferencia. La comunidad identificó un problema recurrente donde "todos publican resultados parciales, y luego nadie puede reproducirlos dos semanas después".
Metodología Estandarizada
El 14 de octubre de 2025, u/ggerganov publicó un hilo de rendimiento de DGX Spark en llama.cpp con una metodología clara: medir prellenado (pp) y generación/decoficación (tg) en múltiples profundidades de contexto y tamaños de lote, utilizando compilaciones CUDA de llama.cpp con llama-bench y llama-batched-bench.
Solución Comunitaria
La comunidad acordó herramientas estandarizadas para la construcción de imágenes de tiempo de ejecución, orquestación y formato de recetas, lanzando Spark Arena el 11 de febrero de 2026.
Líderes Actuales de Rendimiento
Principales resultados de tokens/seg de decodificación de Spark Arena:
- gpt-oss-120b (vLLM, MXFP4, 2 nodos): 75.96 tok/s
- Qwen3-Coder-Next (SGLang, FP8, 2 nodos): 60.51 tok/s
- gpt-oss-120b (vLLM, MXFP4, nodo único): 58.82 tok/s
- NVIDIA-Nemotron-3-Nano-30B-A3B (vLLM, NVFP4, nodo único): 56.11 tok/s
Implicaciones Prácticas
Este enfoque estandarizado proporciona a los desarrolladores datos de rendimiento confiables para seleccionar y configurar LLM de pesos abiertos en hardware DGX Spark, permitiendo decisiones mejor informadas sobre implementación y optimización de modelos.
📖 Read the full source: r/clawdbot
👀 Ver también

Claude AI Muestra Error de Repetición con el Término 'Sketcher' en el Flujo de Trabajo de QGIS
Un usuario reportó que Claude AI repetidamente generaba la palabra 'sketcher' al proporcionar orientación sobre QGIS para alinear archivos DXF, sugiriendo un posible error del modelo con términos específicos. La fuente incluye detalles prácticos del flujo de trabajo de QGIS para la alineación de sistemas de coordenadas.

Claude Cowork unifica los comandos de barra y las habilidades bajo un único concepto.
Claude Cowork ha unificado los comandos de barra diagonal y las habilidades bajo un único concepto llamado 'habilidades', eliminando los encabezados separados en el menú /. Los comandos heredados continúan funcionando como antes.

Mantenedor del kernel de Linux informa sobre un cambio repentino en la calidad de los informes de errores generados por IA.
Greg Kroah-Hartman dice que los informes de errores generados por IA para el kernel de Linux pasaron de ser 'basura de IA' a informes legítimos hace aproximadamente un mes, con equipos de seguridad de código abierto en diferentes proyectos observando el mismo cambio. El equipo del kernel está manejando el aumento con herramientas como Sashiko para la automatización de revisiones.

OpenAI desarrolla un smartphone con IA con chips de MediaTek/Qualcomm; objetivo de producción en masa para 2028
Según el analista de la cadena de suministro Ming-Chi Kuo, OpenAI está desarrollando un teléfono inteligente con IA con los socios de chips MediaTek y Qualcomm, el fabricante exclusivo Luxshare Precision y producción en masa prevista para 2028. El dispositivo está posicionado como una plataforma de agentes de IA conscientes del contexto.