Qwen3.5-122B-A10B-MINT-MLX는 64GB RAM이 탑재된 M5 Pro에서 원활하게 실행됩니다.

애플 실리콘에서의 로컬 LLM 성능
레딧 사용자가 M5 Pro(64GB RAM)에서 Qwen3.5-122B-A10B-MINT-MLX 모델을 로컬로 실행한 경험을 공유했습니다. 이 설정은 적절한 구성으로 대규모 언어 모델이 소비자용 하드웨어에서 효과적으로 실행될 수 있음을 보여줍니다.
구성 세부사항
사용자는 VRAM 할당을 위한 특정 터미널 명령어를 사용하여 원활한 성능을 달성했습니다:
sysctl iogpu.unified_memory_limit_percentage
sudo sysctl iogpu.wired_limit_mb=61440
LM Studio에서 컨텍스트 창을 16384 토큰으로 설정했습니다. 이 구성으로 시스템은 Safari(여러 탭), 메시지, 활동 모니터를 동시에 실행하면서도 안정적인 성능을 유지했습니다.
성능 벤치마크
Qwen3.5-122B-A10B-MINT-MLX 모델의 성능은 다음과 같습니다:
- 첫 토큰까지의 시간: 0.86초
- 토큰 생성 속도: 39.58 토큰/초
사용자는 이 모델이 "여러 수수께끼를 정확히 풀고 약간의 바이브 코딩을 수행했다"고 언급하며, 3비트 MINT 양자화에 대한 불만은 없었습니다. 유일한 문제는 컨텍스트 창이 가득 차 VRAM 사용량이 59GB에 가까워졌을 때 시스템이 멈춘 경우였습니다.
다른 모델과의 비교
사용자는 "Qwen3.5 40B Claude 4.6 Opus Deckard Heretic Uncensored Thinking Mxfp8" 모델도 테스트했는데, 122B 모델보다 정확도는 높지만 속도는 훨씬 느렸습니다:
- 토큰 생성 속도: 6.93 토큰/초
- 생성 속도는 느렸지만 프롬프트 처리 속도는 여전히 빨랐습니다
이는 개발자가 로컬 LLM 구성을 선택할 때 모델 크기, 양자화, 추론 속도 사이에서 고려해야 하는 절충점을 보여줍니다.
📖 전체 원문 읽기: r/LocalLLaMA
👀 See Also

Anthropic은 오픈소스 유지보수자들을 위해 무료 Claude Max 20x를 제공합니다.
Anthropic의 Claude for Open Source 프로그램은 적격한 오픈소스 메인테이너와 기여자에게 6개월간 무료 Claude Max 20x를 제공합니다. 최대 10,000명의 기여자를 대상으로 순차적으로 신청서를 검토합니다.

NVIDIA가 OpenShell 보안 기능을 갖춘 NemoClaw를 발표합니다
NVIDIA가 GTC에서 NemoClaw를 발표했으며, OpenClaw를 기반으로 OpenShell을 통해 AI 에이전트에 정책 기반의 프라이버시 및 보안 가드레일을 적용하여 엔터프라이즈급 보안을 추가했습니다.

클로드 오퍼스 4.7, 오류 증가 문제 발생 — 상태 업데이트
자동 상태 업데이트에서 Claude Opus 4.7에 오류 증가가 보고되었습니다. 인시던트 페이지와 커뮤니티 메가스레드에서 진행 상황을 확인하세요.

Nemotron 3 4B, 까다로운 벤치마크에서 Qwen 3.5 4B에 비해 성능이 떨어집니다
레딧 사용자가 복잡한 수학 및 프로그래밍 작업에서 Nemotron 3 4B Q8과 Qwen 3.5 4B Q8을 비교 테스트한 결과, Nemotron은 올바른 추론과 구조화된 출력을 생성하지 못한 반면 Qwen은 모든 테스트를 통과했습니다.