300달러 노트북으로 Qwen 3.5 35B에서 10.33 t/s 달성: 전체 최적화 분석

Reddit 사용자가 300달러짜리 Lenovo Ideapad Slim 3i(12세대 i3-1215U, 8GB 온보드 + 32GB DDR4 확장)에서 Qwen 3.5 35B 추론을 10.33 t/s로 끌어올렸습니다. 설정은 Q4_K_S 양자화된 MoE 모델(활성 파라미터 약 3B)과 ik_llama.cpp 빌드 4509를 사용합니다.
하드웨어 및 모델
- 노트북: Lenovo Ideapad Slim 3i 2023 (약 $300)
- CPU: Intel i3-1215U (6코어, 2개 성능 코어 사용)
- RAM: 8GB 온보드 + 32GB DDR4 SO-DIMM (Flex 모드)
- OS: Linux Mint
- 모델:
Qwen3.5-35B-A3B-uncensored-heretic-v2-Native-MTP-Preserved-Q4_K_S.gguf(35B MoE, 토큰당 3B 활성 파라미터) - 백엔드: ik_llama.cpp 커밋 40aae0b6, GCC 13.3.0으로 컴파일
적용된 최적화
- BIOS: 배터리 → Extreme 성능 모드; 팬 조용히(끄기) 설정
- OS 전원 프로필: 성능
- 코어 고정:
taskset -c 0,2로 성능 코어 0과 2에 스레드 고정 - 양자화: Q4_K_S
- 배치 크기: 64 (
-ub 64) - 추측 디코딩: MTP 유형, 드래프트 최대 3
- Flash attention, fmoe, rtr — 모두 기본 활성화
- 벤치마크 전 새로 재시작
사용된 명령어
taskset -c 0,2 ./build/bin/llama-cli \
-m "/home/default/LLM Models/Qwen3.5-35B-A3B-uncensored-heretic-v2-Native-MTP-Preserved-Q4_K_S.gguf" \
-p "User: Please explain the history of france \nAI:" \
-n 1028 \
--spec-type mtp \
--draft-max 3 \
-t 2 \
-ub 64 \
--temp 1.0 \
--top-p 0.95 \
--top-k 20 \
--min-p 0.0 \
--presence-penalty 1.5 \
--repeat-penalty 1.0
결과
- 프롬프트 평가: 22.49 t/s
- 추론: 10.33 t/s (1028 토큰 기준)
- 온도: 약 90°C, ik_llama 사용 시 와트 제한 불필요 (이전 llama.cpp에서는 17.5W 제한 필요)
Qwen 3.5 MoE가 빠른 이유
Qwen 3.5 35B MoE 아키텍처는 밀집 모델과 달리 토큰당 약 3B 파라미터만 활성화합니다. 비교를 위해, Gemma 4 26b(4B 활성)는 유사 설정에서 약 3 t/s만 나왔는데, 이는 Qwen 3.5의 MoE 라우팅과 희소 연산이 특히 CPU 친화적임을 시사합니다.
추가 개선 가능성
- XMP 메모리 타이밍을 위한 커스텀 BIOS → +10% t/s
- 고급 서멀 컴파운드 재도포
- DDR4에서 DDR5 노트북 RAM으로 업그레이드 (재도포와 함께 → +20% t/s)
대상: 저가형 하드웨어에서 로컬 LLM을 실행하며 CPU 전용 추론으로 Qwen MoE 모델의 최대 성능을 끌어내고자 하는 개발자.
📖 전체 소스 읽기: r/LocalLLaMA
👀 See Also

Atlas 추론 엔진 오픈소스화: 순수 Rust + CUDA, DGX Spark에서 초당 100+ 토큰
Atlas가 이제 오픈소스가 되었습니다 — 단일 DGX Spark에서 Qwen3.5-35B (NVFP4)에 대해 최대 130 tok/s를 달성하는 Rust + CUDA 추론 엔진으로, Python 런타임이 없고 콜드 스타트가 2분 미만입니다.

alogin: 인간-참여형 AI 에이전트를 위한 Go 기반 보안 게이트웨이
alogin은 Go 기반의 오픈소스 보안 게이트웨이로, AI 에이전트와 인프라 간의 안전한 통로를 제공합니다. Claude Desktop을 위한 내장 MCP 서버 지원, 인간 개입 안전 장치, 암호화된 자격 증명 저장소 등의 기능을 갖추고 있습니다.

개발자가 AI 에이전트 정착, 평판 및 소액 결제를 위한 10개 이상의 MCP 서버를 공유합니다
한 개발자가 Claude Code에서 100개 이상의 에이전트를 가진 BlindOracle을 구축하고, 결제, 평판, 소액 결제를 위한 10개 이상의 MCP 서버를 만들었습니다. 이 아키텍처에는 비공개 커밋-공개 예측, 온체인 점수 매기기, 요청별 소액 결제, 검증 가능한 에이전트 증명이 포함됩니다.

에이전트 시스템에서 결정론적 워크플로가 AI 기반 오케스트레이션보다 뛰어난 이유
에이전트 시스템을 1년간 구축한 경험을 가진 개발자가 AI 기반 오케스트레이션이 비결정적 라우팅, 오류 누적, 비용 폭발, 디버깅 불가능으로 인해 신뢰성 있게 실패했다고 밝혔습니다. 코드 기반 오케스트레이션을 사용한 결정적 워크플로우로 전환하여 오케스트레이션 실패를 제거했습니다.