8GB VRAM + 32GB RAM에서 ~190k 컨텍스트로 Qwen3.6-35B-A3B 실행 – 설정 및 벤치마크

한 Reddit 사용자가 8GB VRAM(RTX 4060)과 32GB DDR5 RAM을 장착한 노트북에서 Qwen3.6-35B-A3B GGUF 모델을 약 190k 컨텍스트로 실행하기 위한 상세 설정을 게시했습니다. 기본으로 37-43 tok/s를 보고했으며, 약간의 조정으로 ~51 tok/s까지 올렸습니다.
하드웨어 및 모델
- GPU: RTX 4060 8GB VRAM
- RAM: 32GB DDR5 5600MHz
- OS: Linux (Windows보다 성능이 좋은 것으로 알려짐)
- 테스트된 모델(Q5 양자화):
mudler/Qwen3.6-35B-A3B-APEX-GGUF– 약 40 tok/s에서 37 tok/shesamation/Qwen3.6-35B-A3B-Claude-4.6-Opus-Reasoning-Distilled-GGUF– 약 43 tok/s에서 37 tok/s
주요 구성
TurboQuant를 지원하는 llama.cpp 포크(turboquant_plus)를 사용하여 사용자는 다음 플래그로 llama-server를 실행합니다:
--model "" \
--host 0.0.0.0 \
--port 8085 \
--ctx-size 192640 \
--n-gpu-layers 430 \
--n-cpu-moe 35 \
--cache-type-k "turbo4" \
--cache-type-v "turbo4" \
--flash-attn on \
--batch-size 2048 \
--parallel 1 \
--no-mmap \
--mlock \
--ubatch-size 512 \
--threads 6 \
--cont-batching \
--timeout 300 \
--temp 0.2 \
--top-p 0.95 \
--min-p 0.05 \
--top-k 20 \
--metrics \
--chat-template-kwargs '{"preserve_thinking": true}'
속도를 ~51 tok/s로 높이려면 세 가지 플래그를 조정하세요: --ctx-size 192640, --n-gpu-layers 430, --n-cpu-moe 35 (안정성/메모리에 따라 약간 조정).
주의사항
- Q4 양자화는 긴 맥락 추론에서 Q5보다 눈에 띄게 성능이 떨어집니다.
--no-mmap+--mlock은 끊김 현상을 줄여줍니다.- TurboQuant KV 캐시는 높은 컨텍스트 크기에서 중요합니다.
- 높은 RAM 대역폭(DDR5)이 이러한 속도에 중요합니다.
- Linux가 이 작업에서 Windows보다 성능이 훨씬 뛰어납니다.
대상 사용자
특히 8-12GB VRAM과 빠른 시스템 RAM을 갖춘 소비자 하드웨어에서 매우 긴 컨텍스트(170k+ 토큰)로 로컬 LLM을 실행하는 개발자.
📖 원문 읽기: r/LocalLLaMA
👀 See Also

원 텔레그램 그룹 채팅에서 두 봇 간의 브릿지 구축: HTTP를 통한 전달 시맨틱스
한 개발자가 동일한 그룹 채팅에서 두 개의 독립적인 텔레그램 봇을 연결하는 실용적인 방법을 공유하며, HTTP 릴레이, ACK, 중복 제거 및 엄격한 범위의 피드를 통해 텔레그램의 봇 간 메시지 전달 문제를 해결합니다.

가이드: GEEKOM IT15 미니 PC에서 llama.cpp로 OpenClaw 배포하기
기술 가이드는 OpenClaw를 Ollama에서 llama.cpp로 전환하여 Intel Arc GPU 가속을 활용해 로컬 Qwen3-8B 모델을 실행하는 과정을 상세히 설명하며, 구성 변경, 수동 서버 관리, 일반적인 문제 해결 방법을 다룹니다.

클로드 인증 에이전트 기초 시험 가이드 불일치 사항 확인
최근 CCA-F 시험 응시자는 공식 시험 가이드, 연습 시험 및 실제 시험 내용 간에 상당한 차이를 보고했습니다. 실제 시험에는 최대 13개의 시나리오가 포함될 수 있지만, 가이드에는 6개만 나열되어 있고 연습 시험은 그 중 4개만 다룹니다.

AWS에서 Claude Code로 월 0.01달러에 서버리스 AI 에이전트 플랫폼 구축하기
한 개발자가 Claude Code를 사용하여 약 29시간 동안 작업하여 월 약 $0.01에 AWS 서버리스 플랫폼에서 실행되는 완전한 AI 에이전트를 구축했습니다. 이 과정에서 NAT Gateway($32/월) 및 ALB($18/월)와 같은 고가의 구성 요소를 제거했습니다. 이 프로젝트에는 233개의 단위 테스트, 35개의 E2E 테스트가 포함되어 있으며, 단일 cdk deploy 명령으로 배포됩니다.