Qwen3.5-397B MoE, M1 Ultra에서 페이지드 전문가 로딩으로 14GB RAM에서 실행

u/ur_dad_matt의 Reddit 게시물(Claude 경유)은 M1 Ultra 64GB Mac Studio에서 Qwen3.5-397B-A17B(디스크 209GB, 512 전문가, top-10 라우팅)를 최대 RAM 14GB, 추론 속도 1.59 tok/s로 실행하는 커스텀 paged MoE 엔진을 보여줍니다. 이 모델은 단순 로딩이 불가능합니다. 엔진은 K=20개의 전문가만 RAM에 유지하고, 라우터 요청 시 SSD에서 나머지를 지연 페이지로 로드하며 캐시 압박 시 제거합니다. 연산은 Float16을 사용하며(MPS에서 ternary보다 빠름), Apple Silicon 네이티브, MLX 기반입니다.
M1 Ultra 64GB에서 5개 프롬프트 스윕 벤치마크 결과:
- 속도: 1.59 tok/s (5개 일관된 생성 평균, K=20)
- 캐시 RSS 피크(생성): 7.91 GB
- 전체 RSS 피크: 14.04 GB
- 일관된 출력: 5/5
최적 엔진 설정: K_override=20, cache_gb=8.0, OUTLIER_MMAP_EXPERTS=0, lazy_load=True. 초기 시도에서 모든 전문가를 디스크에 두면 명령 버퍼 할당 실패가 발생했으나 캐시 크기 조정 후 해결되었습니다.
저자는 64GB 하드웨어의 로컬 LLM에 대해 원시 점수 벤치마크가 의미가 없으며, 핵심 지표는 GB당 MMLU라고 주장합니다. 1.59 tok/s에서 모델은 채팅 속도가 아닌 '생각 속도'로 실행되며, 이는 모델 대 메모리 비율의 상한을 보여줍니다.
동일 하드웨어에서 소형 양자화 모델 속도(MLX-4비트):
- 4B Nano: 71.7 tok/s
- 9B Lite: 53.4 tok/s
- 26B-A4B Quick: 14.6 tok/s
- 27B Core: 40.7 tok/s (MMLU 0.851 n=14042 σ=0.003, HumanEval 0.866 n=164 σ=0.027)
- 35B-A3B Vision: 64.1 tok/s
- 397B Plus: 1.59 tok/s
런타임은 Tauri + Rust + MLX로 macOS용으로 제작되었습니다. 무료 티어(Nano 및 Lite)는 outlier.host에서 영구 제공됩니다. 비디오 데모는 Reddit 게시물에 포함되어 있습니다.
📖 전체 출처 읽기: r/LocalLLaMA
👀 See Also

Claude 코드 에이전트를 CLAUDE.md 및 .claude/ 디렉토리 패턴으로 구조화하기
한 개발자가 Claude Code를 사용하여 여러 AI 에이전트를 운영하는 접근 방식을 공유합니다. 각 에이전트는 CLAUDE.md 파일과 규칙 및 스킬이 담긴 .claude/ 디렉터리를 포함하는 자체 디렉터리를 가집니다. 핵심 통찰은 항상 활성화된 컨텍스트와 주문형 워크플로우를 분리하여 토큰 사용량과 응답 품질을 최적화하는 것입니다.

OpenClaw에서 별도의 작업 공간으로 서브 에이전트 설정하는 방법
여러 하위 에이전트를 격리된 작업 공간과 다양한 모델로 구성하는 커뮤니티 솔루션

클로드 AI 실행 에이전트를 위한 실용적인 프롬프트 구조
한 개발자가 API 호출, 데이터 추출, 다단계 워크플로우를 수행하는 Claude AI 에이전트의 환각 현상을 줄인 프롬프트 엔지니어링 기법을 공유합니다. 주요 전략으로는 프롬프트를 계약서처럼 작성하기, 토큰의 40%를 오류 처리에 할당하기, '대기'와 '중지' 조건을 분리하기 등이 있습니다.

vLLM 설정 및 320GB VRAM을 갖춘 10x NVIDIA V100 서버에서의 테스트
법률 업무를 위한 로컬 AI 서버를 구축한 변호사가 10x Tesla V100 SXM2 32GB GPU에서의 vLLM 테스트 결과를 공유하며, Volta 아키텍처에서 작동하는 것(FP16 비양자화, bitsandbytes 4비트)과 작동하지 않는 것(GPTQ, AWQ, FlashAttention2)을 상세히 설명합니다.