12GB VRAM 벤치마크: RTX 4070 Super에서 Qwen 3.6 및 Gemma 4 모델 실행

한 Reddit 사용자가 12GB RTX 4070 Super(+10% OC)와 AMD 9800X3D CPU, 64GB DDR5-6000 RAM에서 여러 대규모 MoE 모델을 실행한 속도 벤치마크를 공개했습니다. 사용자는 VRAM 절약을 위해 디스플레이를 내장 GPU로 오프로드했으며, 그렇지 않으면 약 10%의 성능 저하가 있다고 언급했습니다. 설정은 CUDA 13.1과 최신 llama.cpp를 사용하며, 하드웨어 구성은 다음과 같습니다:
n-gpu-layers = 999
threads = 8
threads-batch = 16
batch-size = 4096
ubatch-size = 4096
ctx-size = 65536
flash-attn = true
벤치마크 결과
사용자는 VS Code의 Cline 및 KiloCode와 함께 Unsloth GGUF 양자화를 통해 네 가지 모델을 테스트했습니다(도구 호출 문제 없음). 모든 측정값은 초당 토큰 수(tgs)와 초당 처리량(pps)입니다.
- Qwen3.6-35B-A3B-GGUF Q6_K_XL: 40 tgs, 2100 pps
- Qwen3.6-27B-IQ3_XXS: 16 tgs, 1000 pps
- Gemma 4 26B-A4B-it-UD-Q8: 26 tgs, 2150 pps
- Gemma-4-31B-it-IQ3_XXS: 13-16 tgs, 650 pps
주목할 만한 설정 세부사항
사용자는 각 모델의 개별 설정과 특정 튜닝을 공유했습니다. 주요 내용:
- Qwen3.6-35B-A3B:
n-cpu-moe = 35(35개 MoE 전문가를 CPU로 오프로드),cache-type-k = q8_0,cache-type-v = q8_0,swa-full = true,cache-reuse = 512, 컨텍스트 크기 131072, 추론 활성화 및 예산 8096. - Gemma 4 26B:
n-cpu-moe = 27, 컨텍스트 102400,fit = on및fit-target = 256,fit-ctx = 32768. - Gemma 4 31B: 추론 디코딩 사용(
spec-type = ngram-mod),n-gpu-layers = 58(부분 GPU 오프로드),cache-type-k = q4_0,no-kv-offload = true. - 모든 모델:
flash-attn = true,no-mmproj-offload = true.
사용자가 웹 개발에 선호하는 모델은 Qwen3.6-35B-A3B이며, VS Code 확장에서 도구 호출 문제 없이 품질이 뛰어나다고 평가했습니다.
📖 전체 출처 읽기: r/LocalLLaMA
👀 See Also

ChatGPT 기록을 OpenClaw 메모리 시스템으로 내보내기
레딧 사용자가 ai-chat-md-export 도구를 사용하여 ChatGPT 대화 기록을 내보내고 OpenClaw의 메모리 시스템으로 가져오는 과정을 공유하며, 이를 통해 로컬 AI 에이전트가 역사적 맥락에 접근할 수 있게 합니다.

오픈클로 기술 마스터하기: 단계별 가이드
이 포괄적인 가이드를 통해 OpenClaw의 새로운 스킬을 구축하는 방법을 배우고, AI 코딩 에이전트를 활용하여 프로젝트를 향상시키는 핵심 전략을 알아보세요.

AI 에이전트 아키텍처 이해: 결정적 계층 vs 확률적 계층
레딧 사용자가 결정론적 레이어(스크립트, 명령어, API)와 확률론적 레이어(LLM 추론 및 결정)를 구분하는 AI 에이전트 시스템에 대한 멘탈 모델을 공유합니다. 핵심 통찰: 가능한 한 많은 작업을 결정론적 측면으로 밀어넣는 것입니다.

특정 지침과 세부 조정으로 OpenClaw 설정을 최적화하는 방법
OpenClaw 최적화는 정확한 지시와 에이전트 개성의 지속적인 개선, 비용 효율적인 모델 활용에 의존합니다.