8GB VRAM + 32GB RAM에서 ~190k 컨텍스트로 Qwen3.6-35B-A3B 실행 – 설정 및 벤치마크

한 Reddit 사용자가 8GB VRAM(RTX 4060)과 32GB DDR5 RAM을 장착한 노트북에서 Qwen3.6-35B-A3B GGUF 모델을 약 190k 컨텍스트로 실행하기 위한 상세 설정을 게시했습니다. 기본으로 37-43 tok/s를 보고했으며, 약간의 조정으로 ~51 tok/s까지 올렸습니다.
하드웨어 및 모델
- GPU: RTX 4060 8GB VRAM
- RAM: 32GB DDR5 5600MHz
- OS: Linux (Windows보다 성능이 좋은 것으로 알려짐)
- 테스트된 모델(Q5 양자화):
mudler/Qwen3.6-35B-A3B-APEX-GGUF– 약 40 tok/s에서 37 tok/shesamation/Qwen3.6-35B-A3B-Claude-4.6-Opus-Reasoning-Distilled-GGUF– 약 43 tok/s에서 37 tok/s
주요 구성
TurboQuant를 지원하는 llama.cpp 포크(turboquant_plus)를 사용하여 사용자는 다음 플래그로 llama-server를 실행합니다:
--model "" \
--host 0.0.0.0 \
--port 8085 \
--ctx-size 192640 \
--n-gpu-layers 430 \
--n-cpu-moe 35 \
--cache-type-k "turbo4" \
--cache-type-v "turbo4" \
--flash-attn on \
--batch-size 2048 \
--parallel 1 \
--no-mmap \
--mlock \
--ubatch-size 512 \
--threads 6 \
--cont-batching \
--timeout 300 \
--temp 0.2 \
--top-p 0.95 \
--min-p 0.05 \
--top-k 20 \
--metrics \
--chat-template-kwargs '{"preserve_thinking": true}'
속도를 ~51 tok/s로 높이려면 세 가지 플래그를 조정하세요: --ctx-size 192640, --n-gpu-layers 430, --n-cpu-moe 35 (안정성/메모리에 따라 약간 조정).
주의사항
- Q4 양자화는 긴 맥락 추론에서 Q5보다 눈에 띄게 성능이 떨어집니다.
--no-mmap+--mlock은 끊김 현상을 줄여줍니다.- TurboQuant KV 캐시는 높은 컨텍스트 크기에서 중요합니다.
- 높은 RAM 대역폭(DDR5)이 이러한 속도에 중요합니다.
- Linux가 이 작업에서 Windows보다 성능이 훨씬 뛰어납니다.
대상 사용자
특히 8-12GB VRAM과 빠른 시스템 RAM을 갖춘 소비자 하드웨어에서 매우 긴 컨텍스트(170k+ 토큰)로 로컬 LLM을 실행하는 개발자.
📖 원문 읽기: r/LocalLLaMA
👀 See Also

OpenClaw 프롬프트 팽창 및 느린 응답 루프 수정
2026년 4월 26일 이후로 긴 지연을 겪는 사용자는 컨텍스트 bloating을 줄여 성능을 회복할 수 있습니다: 항상 주입되는 파일을 정리하고, 표시되는 스킬을 제한하며, 메인 채팅에 거대한 툴 출력을 붙여넣지 마세요.

커뮤니티 소스에서 수집한 OpenClaw 리소스 목록
GitHub 저장소가 설정, 구성, 메모리 시스템, 보안, 기술, 모델 호환성 및 커뮤니티 링크를 다루는 실용적인 OpenClaw 리소스를 수집하여 개발자들이 일반적인 정보 격차를 피할 수 있도록 돕습니다.

에이전트 지향 API 디자인 패턴: Moltbook의 통찰
Moltbook의 API 설계는 직접적인 지시, 상태 전환, 인지적 도전, 교육적 속도 제한을 통합하여 능동적인 AI 에이전트 상호작용을 지원합니다.
당신의 에이전트는 모델이 아니다: 하네스 대 추론 서비스 설명
AI 에이전트 시스템에서 모델, 추론 서비스, 하네스를 구분하는 빠른 참조 자료입니다. Claude CLI나 Cursor를 사용하시나요? 이 분석을 통해 문제를 더 빨리 해결하고 더 나은 에이전트를 설계할 수 있습니다.