Qwen3.5-397B MoE, M1 Ultra에서 페이지드 전문가 로딩으로 14GB RAM에서 실행

✍️ OpenClawRadar📅 게시일: May 7, 2026🔗 Source
Qwen3.5-397B MoE, M1 Ultra에서 페이지드 전문가 로딩으로 14GB RAM에서 실행
Ad

u/ur_dad_matt의 Reddit 게시물(Claude 경유)은 M1 Ultra 64GB Mac Studio에서 Qwen3.5-397B-A17B(디스크 209GB, 512 전문가, top-10 라우팅)를 최대 RAM 14GB, 추론 속도 1.59 tok/s로 실행하는 커스텀 paged MoE 엔진을 보여줍니다. 이 모델은 단순 로딩이 불가능합니다. 엔진은 K=20개의 전문가만 RAM에 유지하고, 라우터 요청 시 SSD에서 나머지를 지연 페이지로 로드하며 캐시 압박 시 제거합니다. 연산은 Float16을 사용하며(MPS에서 ternary보다 빠름), Apple Silicon 네이티브, MLX 기반입니다.

M1 Ultra 64GB에서 5개 프롬프트 스윕 벤치마크 결과:

  • 속도: 1.59 tok/s (5개 일관된 생성 평균, K=20)
  • 캐시 RSS 피크(생성): 7.91 GB
  • 전체 RSS 피크: 14.04 GB
  • 일관된 출력: 5/5

최적 엔진 설정: K_override=20, cache_gb=8.0, OUTLIER_MMAP_EXPERTS=0, lazy_load=True. 초기 시도에서 모든 전문가를 디스크에 두면 명령 버퍼 할당 실패가 발생했으나 캐시 크기 조정 후 해결되었습니다.

저자는 64GB 하드웨어의 로컬 LLM에 대해 원시 점수 벤치마크가 의미가 없으며, 핵심 지표는 GB당 MMLU라고 주장합니다. 1.59 tok/s에서 모델은 채팅 속도가 아닌 '생각 속도'로 실행되며, 이는 모델 대 메모리 비율의 상한을 보여줍니다.

Ad

동일 하드웨어에서 소형 양자화 모델 속도(MLX-4비트):

  • 4B Nano: 71.7 tok/s
  • 9B Lite: 53.4 tok/s
  • 26B-A4B Quick: 14.6 tok/s
  • 27B Core: 40.7 tok/s (MMLU 0.851 n=14042 σ=0.003, HumanEval 0.866 n=164 σ=0.027)
  • 35B-A3B Vision: 64.1 tok/s
  • 397B Plus: 1.59 tok/s

런타임은 Tauri + Rust + MLX로 macOS용으로 제작되었습니다. 무료 티어(Nano 및 Lite)는 outlier.host에서 영구 제공됩니다. 비디오 데모는 Reddit 게시물에 포함되어 있습니다.

📖 전체 출처 읽기: r/LocalLLaMA

Ad

👀 See Also

Claude VS Code 확장 프로그램 오류 수정: 'command claude-vscode.editor.openLast not found'
Guides

Claude VS Code 확장 프로그램 오류 수정: 'command claude-vscode.editor.openLast not found'

Claude VS Code 확장 프로그램 버전 2.1.51에는 'command claude-vscode.editor.openLast not found' 오류를 발생시키는 중대한 버그가 포함되어 있습니다. 해결 방법은 버전 2.1.49로 다운그레이드하는 것입니다.

OpenClawRadar
개발자가 SaaS 개발 워크플로우를 위해 테스트한 25가지 Claude 프롬프트를 공유합니다
Guides

개발자가 SaaS 개발 워크플로우를 위해 테스트한 25가지 Claude 프롬프트를 공유합니다

한 개발자가 SaaS 개발에 매일 사용하는 25가지 구체적인 프롬프트를 공유했습니다. 백엔드 아키텍처, API 설계, 프론트엔드 카피, 제품 문서화, 시장 진출 작업을 다루며, 코드 리뷰, 문서 생성, 엣지 케이스 테스트 같은 반복 작업에 시간을 절약하도록 설계되었습니다.

OpenClawRadar
🦀
Guides

5μs 내 JIT 컴파일: Postgres pgrust용 고속 JIT 구축하기

pgrust의 JIT 컴파일러는 SQL 쿼리를 약 5μs에 컴파일하여 모든 쿼리에 JIT를 가능하게 합니다. 저자는 AI 지원 어셈블리 타게팅이 빠른 JIT를 실용적으로 만드는 방법을 설명합니다.

OpenClawRadar
OpenClaw + Ollama 로컬 모델 타임아웃 디버깅: 침묵하는 실패를 해결하는 다섯 가지 방법
Guides

OpenClaw + Ollama 로컬 모델 타임아웃 디버깅: 침묵하는 실패를 해결하는 다섯 가지 방법

개발자가 OpenClaw 에이전트가 Gemma 4 26B와 같은 로컬 Ollama 모델에서 자동 타임아웃되는 5가지 근본 원인을 파악했습니다. 여기에는 블로킹 슬러그 생성기, 38K 문자 시스템 프롬프트, 숨겨진 타임아웃 등이 포함됩니다. 해결 방법은 훅 비활성화, 설정 수정, Ollama 설정 조정을 포함합니다.

OpenClawRadar