Qwen3.5-122B-A10B-MINT-MLX는 64GB RAM이 탑재된 M5 Pro에서 원활하게 실행됩니다.

애플 실리콘에서의 로컬 LLM 성능
레딧 사용자가 M5 Pro(64GB RAM)에서 Qwen3.5-122B-A10B-MINT-MLX 모델을 로컬로 실행한 경험을 공유했습니다. 이 설정은 적절한 구성으로 대규모 언어 모델이 소비자용 하드웨어에서 효과적으로 실행될 수 있음을 보여줍니다.
구성 세부사항
사용자는 VRAM 할당을 위한 특정 터미널 명령어를 사용하여 원활한 성능을 달성했습니다:
sysctl iogpu.unified_memory_limit_percentage
sudo sysctl iogpu.wired_limit_mb=61440
LM Studio에서 컨텍스트 창을 16384 토큰으로 설정했습니다. 이 구성으로 시스템은 Safari(여러 탭), 메시지, 활동 모니터를 동시에 실행하면서도 안정적인 성능을 유지했습니다.
성능 벤치마크
Qwen3.5-122B-A10B-MINT-MLX 모델의 성능은 다음과 같습니다:
- 첫 토큰까지의 시간: 0.86초
- 토큰 생성 속도: 39.58 토큰/초
사용자는 이 모델이 "여러 수수께끼를 정확히 풀고 약간의 바이브 코딩을 수행했다"고 언급하며, 3비트 MINT 양자화에 대한 불만은 없었습니다. 유일한 문제는 컨텍스트 창이 가득 차 VRAM 사용량이 59GB에 가까워졌을 때 시스템이 멈춘 경우였습니다.
다른 모델과의 비교
사용자는 "Qwen3.5 40B Claude 4.6 Opus Deckard Heretic Uncensored Thinking Mxfp8" 모델도 테스트했는데, 122B 모델보다 정확도는 높지만 속도는 훨씬 느렸습니다:
- 토큰 생성 속도: 6.93 토큰/초
- 생성 속도는 느렸지만 프롬프트 처리 속도는 여전히 빨랐습니다
이는 개발자가 로컬 LLM 구성을 선택할 때 모델 크기, 양자화, 추론 속도 사이에서 고려해야 하는 절충점을 보여줍니다.
📖 전체 원문 읽기: r/LocalLLaMA
👀 See Also

보륨 AI 단백질체학 경진대회 2026: 13,000달러 상금 및 컴퓨팅 지원
보륨은 2026년에 13,000달러 상금 풀, 인턴십 기회, 컴퓨팅 지원이 포함된 AI 단백질체학 경진대회를 개최합니다. 이 대회는 Hacker News에서 17점과 5개의 댓글과 함께 논의되었습니다.

Claude Code v2.1.187: 구조적 출력 수정, 샌드박스 보안 및 조직 모델 제한
Claude Code v2.1.187에 sandbox.credentials 설정, 조직 모델 제한, 구조화된 출력 루프 수정, 원격 MCP 중단 및 하위 에이전트 깊이 추적 기능이 추가되었습니다.

클로드 오푸스 4.6과 소넷 4.6이 이제 표준 가격으로 100만 컨텍스트를 제공합니다
Claude Opus 4.6과 Sonnet 4.6은 이제 표준 가격으로 완전한 100만 컨텍스트 창을 포함하며, 장문 컨텍스트 프리미엄 없이 요청당 최대 600개의 이미지 또는 PDF 페이지로 확장된 미디어 제한을 제공합니다.

현재 LLM 비용 비교: Deepseek, Qwen, MiniMax 대 OpenAI
레딧 분석에 따르면 Deepseek-V3.2가 100만 토큰당 $0.26/$0.38로 GPT-4보다 약 10배 저렴하면서 GPT-5 급 벤치마크 성능을 제공하며, Qwen3.5와 MiniMax-M2.5는 Claude와 OpenAI에 대한 경쟁력 있는 대안을 제시합니다.