M1 Ultra에서 1M 토큰 컨텍스트로 Nemotron 3 Super 120B 벤치마킹하기

Nemotron 3 Super로 로컬 100만 토큰 컨텍스트 테스트
레딧 사용자가 M1 Ultra 시스템에서 Nemotron 3 Super 120B를 사용하여 100만 토큰 컨텍스트를 로컬에서 처리하는 가능성을 평가하기 위한 벤치마크 테스트를 수행했습니다. 이 테스트는 증가된 컨텍스트 길이에서 메모리 효율성을 제공하는 모델의 하이브리드 맘바-2 아키텍처를 활용했습니다.
하드웨어 및 설정 세부사항
테스트는 다음과 같은 구성으로 llama.cpp를 사용하여 M1 Ultra에서 실행되었습니다:
- 모델: Nemotron-3-Super-120B-Q4_K.gguf (Q4_K_M 양자화)
- 컨텍스트 할당: 전체 100만 토큰
- VRAM 사용량: 약 90GB
- 백엔드: MTL,BLAS, 1 스레드
- 통합 배치 크기: 2048
- 플래시 어텐션: 활성화됨 (fa 1)
- GPU 레이어: 99 (-ngl 99)
벤치마크 명령어 및 결과
사용자는 다음 명령어로 llama-bench를 실행했습니다:
llama-bench -m ~/ml-models/huggingface/ggml-org/Nemotron-3-Super-120B-GGUF/Nemotron-3-Super-120B-Q4_K.gguf -fa 1 -t 1 -ngl 99 -b 2048 -ub 2048 -d 0,10000,20000,30000,40000,50000,60000,70000,80000,90000,100000,150000,200000,250000,1000000벤치마크의 주요 성능 결과:
- 0 컨텍스트에서 프롬프트 처리 (pp512): 255.03 ± 0.36 토큰/초
- 0 컨텍스트에서 토큰 생성 (tg128): 26.72 ± 0.02 토큰/초
- 10만 토큰 컨텍스트에서 프롬프트 처리: 184.99 ± 0.19 토큰/초
- 10만 토큰 컨텍스트에서 토큰 생성: 22.37 ± 0.01 토큰/초
- 15만 토큰 컨텍스트에서 프롬프트 처리: 161.60 ± 0.22 토큰/초
- 15만 토큰 컨텍스트에서 토큰 생성: 20.58 ± 0.01 토큰/초
- 20만 토큰 컨텍스트에서 프롬프트 처리: 141.87 ± 0.19 토큰/초
결과는 컨텍스트 길이가 증가함에 따라 성능이 저하되는 것을 보여주며, 프롬프트 처리 속도가 0 컨텍스트에서 255 t/s에서 20만 토큰에서 약 142 t/s로 떨어집니다.
시스템 정보
Metal 백엔드 초기화는 다음을 보여주었습니다:
- GPU 이름: MTL0
- GPU 패밀리: MTLGPUFamilyApple7 (1007)
- 통합 메모리 보유: true
- BFloat 지원: true
- 권장 최대 작업 세트 크기: 134,217.73 MB
이 테스트는 고급 애플 실리콘 하드웨어와 양자화된 모델을 사용하면 극도로 큰 컨텍스트(최대 100만 토큰)의 로컬 처리가 기술적으로 가능하지만, 컨텍스트가 확장됨에 따라 상당한 메모리 요구사항과 성능 절충이 있음을 보여줍니다.
📖 Read the full source: r/LocalLLaMA
👀 See Also

클로드 커맨드 센터 v5.0.0, 세션 중 전환 기능으로 페이블 5 출시일 지원 추가
Claude Command Center v5.0.0이 Anthropic의 새로운 등급 Fable 5를 공식 지원합니다. 세션 중간 모델 전환, 재설계된 모델 선택기, 버전 별칭 CLI 오류 수정이 포함됩니다.

클로드 코드 v2.1.59는 자동 메모리 기능, 복사 명령어, 그리고 셸 개선 사항을 추가했습니다.
Claude Code v2.1.59은 자동 메모리 관리에 대한 자동 컨텍스트 저장 기능을 /memory 명령어로 도입하고, 인터랙티브 코드 블록 선택을 위한 /copy 명령어를 추가하며, 복합 bash 명령어에 대한 접두사 제안 기능을 개선했습니다.

비고: Claude 코드 워크플로우용 마크다운 주석 도구
Remark은 Claude Code 검토 워크플로우를 위해 개발자가 Markdown 파일에 인라인 주석을 달 수 있게 해주는 네이티브 macOS 앱입니다. 에이전트를 위한 주석을 JSON으로 내보내며 .claude/skills/ 디렉토리에 설치된 스킬을 통해 통합됩니다.
无令牌API网关在模型间路由AI流量,将成本减半
토큰리스는 AI 에이전트 요청을 턴 단위로 모델 간 동적 라우팅하는 API 게이트웨이입니다. 여러 모델에 분산 요청하여 중간 생성 결과 중 최적을 선택함으로써 Claude Fable 5와 동등한 성능을 절반 비용으로 제공합니다.