300달러 노트북으로 Qwen 3.5 35B에서 10.33 t/s 달성: 전체 최적화 분석

✍️ OpenClawRadar📅 게시일: June 14, 2026🔗 Source
300달러 노트북으로 Qwen 3.5 35B에서 10.33 t/s 달성: 전체 최적화 분석
Ad

Reddit 사용자가 300달러짜리 Lenovo Ideapad Slim 3i(12세대 i3-1215U, 8GB 온보드 + 32GB DDR4 확장)에서 Qwen 3.5 35B 추론을 10.33 t/s로 끌어올렸습니다. 설정은 Q4_K_S 양자화된 MoE 모델(활성 파라미터 약 3B)과 ik_llama.cpp 빌드 4509를 사용합니다.

하드웨어 및 모델

  • 노트북: Lenovo Ideapad Slim 3i 2023 (약 $300)
  • CPU: Intel i3-1215U (6코어, 2개 성능 코어 사용)
  • RAM: 8GB 온보드 + 32GB DDR4 SO-DIMM (Flex 모드)
  • OS: Linux Mint
  • 모델: Qwen3.5-35B-A3B-uncensored-heretic-v2-Native-MTP-Preserved-Q4_K_S.gguf (35B MoE, 토큰당 3B 활성 파라미터)
  • 백엔드: ik_llama.cpp 커밋 40aae0b6, GCC 13.3.0으로 컴파일

적용된 최적화

  • BIOS: 배터리 → Extreme 성능 모드; 팬 조용히(끄기) 설정
  • OS 전원 프로필: 성능
  • 코어 고정: taskset -c 0,2로 성능 코어 0과 2에 스레드 고정
  • 양자화: Q4_K_S
  • 배치 크기: 64 (-ub 64)
  • 추측 디코딩: MTP 유형, 드래프트 최대 3
  • Flash attention, fmoe, rtr — 모두 기본 활성화
  • 벤치마크 전 새로 재시작
Ad

사용된 명령어

taskset -c 0,2 ./build/bin/llama-cli \
  -m "/home/default/LLM Models/Qwen3.5-35B-A3B-uncensored-heretic-v2-Native-MTP-Preserved-Q4_K_S.gguf" \
  -p "User: Please explain the history of france \nAI:" \
  -n 1028 \
  --spec-type mtp \
  --draft-max 3 \
  -t 2 \
  -ub 64 \
  --temp 1.0 \
  --top-p 0.95 \
  --top-k 20 \
  --min-p 0.0 \
  --presence-penalty 1.5 \
  --repeat-penalty 1.0

결과

  • 프롬프트 평가: 22.49 t/s
  • 추론: 10.33 t/s (1028 토큰 기준)
  • 온도: 약 90°C, ik_llama 사용 시 와트 제한 불필요 (이전 llama.cpp에서는 17.5W 제한 필요)

Qwen 3.5 MoE가 빠른 이유

Qwen 3.5 35B MoE 아키텍처는 밀집 모델과 달리 토큰당 약 3B 파라미터만 활성화합니다. 비교를 위해, Gemma 4 26b(4B 활성)는 유사 설정에서 약 3 t/s만 나왔는데, 이는 Qwen 3.5의 MoE 라우팅과 희소 연산이 특히 CPU 친화적임을 시사합니다.

추가 개선 가능성

  • XMP 메모리 타이밍을 위한 커스텀 BIOS → +10% t/s
  • 고급 서멀 컴파운드 재도포
  • DDR4에서 DDR5 노트북 RAM으로 업그레이드 (재도포와 함께 → +20% t/s)

대상: 저가형 하드웨어에서 로컬 LLM을 실행하며 CPU 전용 추론으로 Qwen MoE 모델의 최대 성능을 끌어내고자 하는 개발자.

📖 전체 소스 읽기: r/LocalLLaMA

Ad

👀 See Also

SIDJUA v0.9.7: 사전 행동 거버넌스 시행 기능을 갖춘 오픈소스 멀티 에이전트 AI
Tools

SIDJUA v0.9.7: 사전 행동 거버넌스 시행 기능을 갖춘 오픈소스 멀티 에이전트 AI

SIDJUA v0.9.7은 자체 호스팅 가능한 오픈 소스 멀티 에이전트 AI 프레임워크로, 에이전트가 행동하기 전에 거버넌스 규칙을 적용하여 예산 초과나 범위 위반과 같은 무단 행동을 차단합니다. 여러 LLM 제공업체를 지원하며, 4GB RAM에서 실행되며, Tauri v2로 구축된 데스크톱 GUI를 포함합니다.

OpenClawRadar
로컬 AI 에이전트 워크플로우: OpenCode, FastMCP, DeepSeek-r1 활용
Tools

로컬 AI 에이전트 워크플로우: OpenCode, FastMCP, DeepSeek-r1 활용

한 개발자가 OpenCode와 AGENTS.md 파일을 사용해 결정론적 시스템 프롬프트를 구성하고, FastMCP로 로컬 함수를 노출하며, Ollama의 DeepSeek-r1을 테스트 같은 특정 하위 에이전트에 활용하는 로컬 AI 에이전트 설정을 공유했습니다.

OpenClawRadar
depct: MCP 서버는 Claude에 실시간 런타임 분석 및 문서화 기능을 제공합니다
Tools

depct: MCP 서버는 Claude에 실시간 런타임 분석 및 문서화 기능을 제공합니다

depct는 Node.js 애플리케이션을 계측하여 런타임 데이터를 수집하고, Claude가 코딩 전에 접근할 수 있는 신뢰도 수준이 표시된 구조화된 문서를 생성하는 MCP 서버입니다. 이 도구는 Claude가 변경 사항을 적용한 후 자동으로 문서를 업데이트합니다.

OpenClawRadar
전화 기반 AI 실험을 통한 ANE 최적화는 커널 융합의 이점을 보여줍니다
Tools

전화 기반 AI 실험을 통한 ANE 최적화는 커널 융합의 이점을 보여줍니다

한 개발자가 Apple Neural Engine 최적화를 위해 55번의 실험을 진행했으며, 클로드를 활용한 브레인스토밍을 통해 휴대폰에서 프로세스를 주도했습니다. 주요 개선 사항으로는 3개의 ANE 커널을 1개의 메가 커널로 융합하여 검증 손실을 3.75에서 2.49로, 단계 시간을 176ms에서 96ms로 단축한 것이 포함됩니다.

OpenClawRadar