NVIDIA, Nemotron-3-Ultra-550B 출시: 550억 개의 활성 파라미터, 100만 컨텍스트, LatentMoE 하이브리드

NVIDIA가 Nemotron-3-Ultra-550B-A55B-BF16을 출시했습니다. 총 550B 파라미터 중 55B가 활성화되는 최첨단 LLM입니다. 이 모델은 Latent Mixture-of-Experts (LatentMoE) 하이브리드 아키텍처를 사용하며, Mamba-2, MoE, 어텐션 레이어를 혼합하고 다중 토큰 예측(MTP)으로 생성 속도를 높입니다. 컨텍스트 길이는 최대 100만 토큰입니다.
주요 사양
- 아키텍처: LatentMoE 하이브리드 – Mamba-2 + MoE + Attention + MTP
- 파라미터: 총 550B / 활성 55B
- 컨텍스트: 최대 100만 토큰
- 최소 GPU: 8x GB200/B200/GB300/B300, 16x H100, 8x H200
- 언어: 영어, 프랑스어, 스페인어, 이탈리아어, 독일어, 일본어, 한국어, 힌디어, 브라질 포르투갈어, 중국어
- 추론: 채팅 템플릿으로 온/오프 구성 가능 (
enable_thinking=True/False) - 라이선스: OpenMDW License Agreement v1.1
이 모델은 최첨단 추론, 복잡한 에이전트 워크플로, 장문 컨텍스트 분석, 도구 사용, 다국어 추론, 고위험 RAG에 적합합니다. 컴퓨팅 효율성을 위한 NVFP4 사전 학습 레시피로 훈련되었습니다. 오픈 웨이트, 학습 데이터, 레시피가 OpenMDW 라이선스에 포함되어 있습니다. 로컬 추론에는 최소 8x H200 또는 이에 준하는 장비가 필요합니다.
📖 전체 출처 읽기: r/LocalLLaMA
👀 See Also

클로드 4.6 적응형 사고: 레딧 사용자가 토큰 낭비를 보고하고 비활성화 명령어를 제공함
레딧 사용자가 Claude 4.6의 새로운 적응형 사고 기능이 Claude Code에서 토큰을 낭비하고 지연 시간을 추가할 수 있다고 보고하며, 이를 비활성화하거나 사고 토큰을 제한하는 셸 명령어를 제공합니다.

OpenClaw 2026.3.13 회귀 문제로 인해 도달 불가 상태가 잘못 보고됩니다.
OpenClaw 버전 2026.3.13에서 RPC 프로브는 정상적으로 작동함에도 불구하고 상태 명령이 도달 불가능한 게이트웨이를 잘못 보고하는 진단 회귀 현상이 도입되었습니다. 2026.3.12 버전으로 롤백하면 문제가 해결됩니다.

OpenClaw 2026.3.28: MiniMax 사용자를 위한 주요 변경 사항, 설정 자동 복구 기능 제거됨
OpenClaw 2026.3.28은 더 이상 사용되지 않는 설정 키에 대한 자동 복구 기능을 제거하고 여러 MiniMax 모델을 제거했습니다. 사용자는 게이트웨이 시작 실패를 방지하기 위해 업그레이드 전에 설정을 업데이트해야 합니다.

마이크로소프트, AI 투자 1900억 달러 유지 — 첫 하이퍼스케일러가 선을 지키다
마이크로소프트가 AI 자본 지출 전망을 1900억 달러로 유지하면서 경쟁사들이 지출을 늘리는 추세를 거스르자 주가가 8% 급등했습니다. 한편, 메모리 칩 가격 상승이 업계 전체 자본 지출 증가의 약 45%를 차지할 수 있습니다.