Nvidia의 Nemotron 3 Super: 120B 파라미터 모델, 12B 활성 추론

✍️ OpenClawRadar📅 게시일: March 12, 2026🔗 Source
Nvidia의 Nemotron 3 Super: 120B 파라미터 모델, 12B 활성 추론
Ad

Nvidia는 추론 시에 120억 개의 파라미터만 활성화하는 1200억 파라미터 모델인 Nemotron 3 Super를 공개했습니다. 이는 1200억 규모 모델의 지식을 약 120억 규모 모델의 연산 비용으로 제공함으로써, 더 큰 모델이 항상 더 나은 결과를 의미한다는 가정에 도전합니다. 이 모델은 압축을 통해 더 큰 모델을 근사화하는 것이 아닙니다. 이는 효율적으로 라우팅하는 법을 배운 1200억 규모 모델로, 관련될 때는 다른 1080억 개의 파라미터를 사용할 수 있고, 관련되지 않을 때는 유휴 상태로 둡니다.

아키텍처 결정

세 가지 핵심 아키텍처 결정이 이를 가능하게 합니다:

  • LatentMoE: 라우팅 전에 토큰을 압축된 잠재 공간으로 투영하여 라우팅 결정을 더 저렴하게 만듭니다. 이를 통해 표준 MoE와 동일한 추론 비용으로 4배 더 많은 전문가를 활성화할 수 있습니다.
  • 하이브리드 맘바-어텐션: 대부분의 시퀀스 처리에 대해 2차적으로 비용이 많이 드는 트랜스포머 어텐션을 Mamba-2로 대체하여, 100만 토큰 컨텍스트 창을 이론적이 아닌 실용적으로 만듭니다. 100만 토큰에서 RULER 정확도 91.75%를 달성합니다.
  • 다중 토큰 예측: 순방향 패스당 여러 미래 토큰을 생성하여, 별도의 초안 모델 없이도 최대 3배 빠른 실제 추론 속도로 기본적인 추측 디코딩을 제공합니다. 이전 모델보다 5배 높은 처리량을 달성하며, 토큰당 3배 더 많은 파라미터를 활성화하는 모델들을 능가합니다.
Ad

더 넓은 추세

이는 이 아키텍처 접근 방식의 세 번째 독립적인 확인입니다. DeepSeek V3가 처음으로 총 6710억 파라미터와 370억 활성 파라미터로 이를 입증하며, Llama 3 405B 조밀 모델을 능가했습니다. Qwen3-Coder-Next는 총 800억 파라미터와 추론 시에 3억 활성 파라미터만으로 이어졌으며, SWE-Bench Pro에서 Claude Sonnet 4.5와 동등한 성능을 보이고 토큰당 370억 파라미터를 활성화하는 DeepSeek V3를 능가했습니다. 효율성 향상은 상쇄되지 않고 누적됩니다. 각 아키텍처 결정은 조밀 어텐션보다 규모 확장에서 더 많은 이점을 얻으며, 이 아키텍처와 조밀 트랜스포머 간의 격차는 모델 규모가 커질수록 증가합니다.

이 세 가지 독립적인 출시에서 얻은 핵심 통찰은 능력 향상의 길이 더 많은 활성화가 아니라 더 나은 라우팅이라는 것입니다. 파라미터 수 순위표는 계속해서 숫자를 발표하겠지만, 토큰당 활성 파라미터 수는 모델 효율성과 성능을 비교하는 더 정직한 지표가 되어가고 있습니다.

📖 Read the full source: r/LocalLLaMA

Ad

👀 See Also

클로드.ai 현재 다운, API 오류 증가 — 2026년 4월 28일
News

클로드.ai 현재 다운, API 오류 증가 — 2026년 4월 28일

Claude의 공식 상태 페이지에서 트리거된 자동 상태 업데이트에 따르면, 2026-04-28T17:51:36.000Z 기준으로 Claude.ai를 사용할 수 없고 API에서 오류율이 높아지고 있습니다.

OpenClawRadar
CivBench: 문명 VI로 AI 전략적 추론 테스트 — 에이전트, 문화 전쟁에서 패배한 후 툴루즈에 핵 공격
News

CivBench: 문명 VI로 AI 전략적 추론 테스트 — 에이전트, 문화 전쟁에서 패배한 후 툴루즈에 핵 공격

문명 VI를 플레이하는 AI 에이전트가 프랑스의 문화 승리가 불가피해지자 핵무기를 개발했습니다. 실험인 CivBench는 장기적 전략 추론 능력을 테스트합니다. GovBench(GPT-5 99.26%) 같은 객관식 벤치마크로는 측정할 수 없는 능력입니다. 76개의 MCP 도구가 게임 상태를 텍스트로 노출합니다.

OpenClawRadar
칸 영화 제작비 50만 달러, 그중 40만 달러는 AI 컴퓨팅 비용
News

칸 영화 제작비 50만 달러, 그중 40만 달러는 AI 컴퓨팅 비용

칸 영화제에 상영된 한 영화는 제작비가 50만 달러였지만, 그중 40만 달러가 AI 컴퓨팅 비용으로 사용되었습니다. 생성형 비디오 파이프라인을 구축하는 AI 에이전트 개발자에게 주목할 만한 비용 벤치마크입니다.

OpenClawRadar
Qwen3-30B-A3B 대 Qwen3.5-35B-A3B 성능 비교 (RTX 5090 기준)
News

Qwen3-30B-A3B 대 Qwen3.5-35B-A3B 성능 비교 (RTX 5090 기준)

RTX 5090에서 Qwen3-30B-A3B와 Qwen3.5-35B-A3B의 직접 비교 벤치마크 결과, 30B 모델이 생성 속도에서 35% 더 빠른 반면, 3.5 모델은 긴 컨텍스트를 더 잘 처리하며 토큰 스케일링이 평탄한 반면 30B 모델은 21% 성능 저하를 보였습니다.

OpenClawRadar