NVIDIA DGX Spark 커뮤니티, 재현 가능한 LLM 벤치마크를 위한 Spark Arena 출시

NVIDIA DGX Spark 커뮤니티는 DGX Spark 하드웨어에서 오픈 웨이트 대규모 언어 모델을 위한 재현 가능한 벤치마킹 플랫폼인 Spark Arena를 설립하여, 이전에 존재했던 일관되지 않은 보고 문제를 해결했습니다.
배경과 문제점
NVIDIA는 2025년 10월 중순에 DGX Spark를 데스크탑 박스 형태로 출시하기 시작했으며, 통합 메모리를 통해 대규모 모델을 로컬에서 실행할 수 있어 추론을 위한 약 200B 파라미터 모델도 포함됩니다. 커뮤니티는 "모두가 부분적인 결과만 게시하고, 두 주 후에는 아무도 재현할 수 없다"는 반복적인 문제를 확인했습니다.
표준화된 방법론
2025년 10월 14일, u/ggerganov는 llama.cpp에 DGX Spark 성능 스레드를 게시하며 명확한 방법론을 제시했습니다: 여러 컨텍스트 깊이와 배치 크기에 걸쳐 프리필(pp)과 생성/디코드(tg)를 측정하며, llama.cpp CUDA 빌드와 llama-bench 및 llama-batched-bench를 사용합니다.
커뮤니티 솔루션
커뮤니티는 런타임 이미지 빌딩, 오케스트레이션 및 레시피 형식을 위한 표준화된 도구에 합의하여, 2026년 2월 11일에 Spark Arena를 출시했습니다.
현재 성능 선두주자
Spark Arena의 최고 디코드 토큰/초 결과:
- gpt-oss-120b (vLLM, MXFP4, 2 노드): 75.96 토큰/초
- Qwen3-Coder-Next (SGLang, FP8, 2 노드): 60.51 토큰/초
- gpt-oss-120b (vLLM, MXFP4, 단일 노드): 58.82 토큰/초
- NVIDIA-Nemotron-3-Nano-30B-A3B (vLLM, NVFP4, 단일 노드): 56.11 토큰/초
실질적 영향
이 표준화된 접근 방식은 개발자들에게 DGX Spark 하드웨어에서 오픈 웨이트 LLM을 선택하고 구성하기 위한 신뢰할 수 있는 성능 데이터를 제공하여, 모델 배포 및 최적화에 대한 더 나은 결정을 내릴 수 있게 합니다.
📖 전체 출처 읽기: r/clawdbot
👀 See Also

클로드.ai 현재 다운, API 오류 증가 — 2026년 4월 28일
Claude의 공식 상태 페이지에서 트리거된 자동 상태 업데이트에 따르면, 2026-04-28T17:51:36.000Z 기준으로 Claude.ai를 사용할 수 없고 API에서 오류율이 높아지고 있습니다.

OpenClaw 클라이언트, 비용 추적 및 에이전트별 지출 한도 추가
새 릴리스에서는 에이전트별 지출 상한, 원형 진행 표시줄이 있는 실시간 사용량 UI, 하위 에이전트 관리, 스킬 토글, 에이전트별 모델 선택 기능이 추가되었습니다.

Cron 자동 업데이트가 설정 검증 오류로 인해 OpenClaw를 손상시켰습니다.
OpenClaw 자동 업데이트를 위해 설정된 cron 작업이 cliBackends 필드에 대한 구성 검증 문제를 만나 연결이 끊겼습니다. 문제가 있는 섹션을 제거하고 게이트웨이를 재시작하여 해결했습니다.

최신 AI 모델 벤치마킹: 극단적 모델의 부상
40개의 새로운 AI 모델에 대한 상세한 벤치마킹 결과, '갓 모드'와 '플래시 모드'가 선두를 달리는 분화된 시장이 드러났습니다. 중간급 모델들은 이제 구식으로 간주되고 있습니다.