8GB VRAM + 32GB RAM에서 ~190k 컨텍스트로 Qwen3.6-35B-A3B 실행 – 설정 및 벤치마크

✍️ OpenClawRadar📅 게시일: May 10, 2026🔗 Source
8GB VRAM + 32GB RAM에서 ~190k 컨텍스트로 Qwen3.6-35B-A3B 실행 – 설정 및 벤치마크
Ad

한 Reddit 사용자가 8GB VRAM(RTX 4060)과 32GB DDR5 RAM을 장착한 노트북에서 Qwen3.6-35B-A3B GGUF 모델을 약 190k 컨텍스트로 실행하기 위한 상세 설정을 게시했습니다. 기본으로 37-43 tok/s를 보고했으며, 약간의 조정으로 ~51 tok/s까지 올렸습니다.

하드웨어 및 모델

  • GPU: RTX 4060 8GB VRAM
  • RAM: 32GB DDR5 5600MHz
  • OS: Linux (Windows보다 성능이 좋은 것으로 알려짐)
  • 테스트된 모델(Q5 양자화):
    • mudler/Qwen3.6-35B-A3B-APEX-GGUF – 약 40 tok/s에서 37 tok/s
    • hesamation/Qwen3.6-35B-A3B-Claude-4.6-Opus-Reasoning-Distilled-GGUF – 약 43 tok/s에서 37 tok/s
Ad

주요 구성

TurboQuant를 지원하는 llama.cpp 포크(turboquant_plus)를 사용하여 사용자는 다음 플래그로 llama-server를 실행합니다:

--model "" \
--host 0.0.0.0 \
--port 8085 \
--ctx-size 192640 \
--n-gpu-layers 430 \
--n-cpu-moe 35 \
--cache-type-k "turbo4" \
--cache-type-v "turbo4" \
--flash-attn on \
--batch-size 2048 \
--parallel 1 \
--no-mmap \
--mlock \
--ubatch-size 512 \
--threads 6 \
--cont-batching \
--timeout 300 \
--temp 0.2 \
--top-p 0.95 \
--min-p 0.05 \
--top-k 20 \
--metrics \
--chat-template-kwargs '{"preserve_thinking": true}'

속도를 ~51 tok/s로 높이려면 세 가지 플래그를 조정하세요: --ctx-size 192640, --n-gpu-layers 430, --n-cpu-moe 35 (안정성/메모리에 따라 약간 조정).

주의사항

  • Q4 양자화는 긴 맥락 추론에서 Q5보다 눈에 띄게 성능이 떨어집니다.
  • --no-mmap + --mlock은 끊김 현상을 줄여줍니다.
  • TurboQuant KV 캐시는 높은 컨텍스트 크기에서 중요합니다.
  • 높은 RAM 대역폭(DDR5)이 이러한 속도에 중요합니다.
  • Linux가 이 작업에서 Windows보다 성능이 훨씬 뛰어납니다.

대상 사용자

특히 8-12GB VRAM과 빠른 시스템 RAM을 갖춘 소비자 하드웨어에서 매우 긴 컨텍스트(170k+ 토큰)로 로컬 LLM을 실행하는 개발자.

📖 원문 읽기: r/LocalLLaMA

Ad

👀 See Also

원 텔레그램 그룹 채팅에서 두 봇 간의 브릿지 구축: HTTP를 통한 전달 시맨틱스
Guides

원 텔레그램 그룹 채팅에서 두 봇 간의 브릿지 구축: HTTP를 통한 전달 시맨틱스

한 개발자가 동일한 그룹 채팅에서 두 개의 독립적인 텔레그램 봇을 연결하는 실용적인 방법을 공유하며, HTTP 릴레이, ACK, 중복 제거 및 엄격한 범위의 피드를 통해 텔레그램의 봇 간 메시지 전달 문제를 해결합니다.

OpenClawRadar
가이드: GEEKOM IT15 미니 PC에서 llama.cpp로 OpenClaw 배포하기
Guides

가이드: GEEKOM IT15 미니 PC에서 llama.cpp로 OpenClaw 배포하기

기술 가이드는 OpenClaw를 Ollama에서 llama.cpp로 전환하여 Intel Arc GPU 가속을 활용해 로컬 Qwen3-8B 모델을 실행하는 과정을 상세히 설명하며, 구성 변경, 수동 서버 관리, 일반적인 문제 해결 방법을 다룹니다.

OpenClawRadar
클로드 인증 에이전트 기초 시험 가이드 불일치 사항 확인
Guides

클로드 인증 에이전트 기초 시험 가이드 불일치 사항 확인

최근 CCA-F 시험 응시자는 공식 시험 가이드, 연습 시험 및 실제 시험 내용 간에 상당한 차이를 보고했습니다. 실제 시험에는 최대 13개의 시나리오가 포함될 수 있지만, 가이드에는 6개만 나열되어 있고 연습 시험은 그 중 4개만 다룹니다.

OpenClawRadar
AWS에서 Claude Code로 월 0.01달러에 서버리스 AI 에이전트 플랫폼 구축하기
Guides

AWS에서 Claude Code로 월 0.01달러에 서버리스 AI 에이전트 플랫폼 구축하기

한 개발자가 Claude Code를 사용하여 약 29시간 동안 작업하여 월 약 $0.01에 AWS 서버리스 플랫폼에서 실행되는 완전한 AI 에이전트를 구축했습니다. 이 과정에서 NAT Gateway($32/월) 및 ALB($18/월)와 같은 고가의 구성 요소를 제거했습니다. 이 프로젝트에는 233개의 단위 테스트, 35개의 E2E 테스트가 포함되어 있으며, 단일 cdk deploy 명령으로 배포됩니다.

OpenClawRadar