12GB VRAM 벤치마크: RTX 4070 Super에서 Qwen 3.6 및 Gemma 4 모델 실행

한 Reddit 사용자가 12GB RTX 4070 Super(+10% OC)와 AMD 9800X3D CPU, 64GB DDR5-6000 RAM에서 여러 대규모 MoE 모델을 실행한 속도 벤치마크를 공개했습니다. 사용자는 VRAM 절약을 위해 디스플레이를 내장 GPU로 오프로드했으며, 그렇지 않으면 약 10%의 성능 저하가 있다고 언급했습니다. 설정은 CUDA 13.1과 최신 llama.cpp를 사용하며, 하드웨어 구성은 다음과 같습니다:
n-gpu-layers = 999
threads = 8
threads-batch = 16
batch-size = 4096
ubatch-size = 4096
ctx-size = 65536
flash-attn = true
벤치마크 결과
사용자는 VS Code의 Cline 및 KiloCode와 함께 Unsloth GGUF 양자화를 통해 네 가지 모델을 테스트했습니다(도구 호출 문제 없음). 모든 측정값은 초당 토큰 수(tgs)와 초당 처리량(pps)입니다.
- Qwen3.6-35B-A3B-GGUF Q6_K_XL: 40 tgs, 2100 pps
- Qwen3.6-27B-IQ3_XXS: 16 tgs, 1000 pps
- Gemma 4 26B-A4B-it-UD-Q8: 26 tgs, 2150 pps
- Gemma-4-31B-it-IQ3_XXS: 13-16 tgs, 650 pps
주목할 만한 설정 세부사항
사용자는 각 모델의 개별 설정과 특정 튜닝을 공유했습니다. 주요 내용:
- Qwen3.6-35B-A3B:
n-cpu-moe = 35(35개 MoE 전문가를 CPU로 오프로드),cache-type-k = q8_0,cache-type-v = q8_0,swa-full = true,cache-reuse = 512, 컨텍스트 크기 131072, 추론 활성화 및 예산 8096. - Gemma 4 26B:
n-cpu-moe = 27, 컨텍스트 102400,fit = on및fit-target = 256,fit-ctx = 32768. - Gemma 4 31B: 추론 디코딩 사용(
spec-type = ngram-mod),n-gpu-layers = 58(부분 GPU 오프로드),cache-type-k = q4_0,no-kv-offload = true. - 모든 모델:
flash-attn = true,no-mmproj-offload = true.
사용자가 웹 개발에 선호하는 모델은 Qwen3.6-35B-A3B이며, VS Code 확장에서 도구 호출 문제 없이 품질이 뛰어나다고 평가했습니다.
📖 전체 출처 읽기: r/LocalLLaMA
👀 See Also

로컬 AI 코딩 에이전트 설정을 위한 OpenCode 시작하기
초보자 가이드는 Mac, Linux, Windows(WSL2)에서 LM Studio, llama.cpp 또는 Ollama를 통해 ByteShape의 최적화된 모델을 사용하여 OpenCode를 완전히 로컬 AI 코딩 에이전트로 설정하는 과정을 안내합니다.

특정 지침과 세부 조정으로 OpenClaw 설정을 최적화하는 방법
OpenClaw 최적화는 정확한 지시와 에이전트 개성의 지속적인 개선, 비용 효율적인 모델 활용에 의존합니다.

Claude를 사용하여 쓰기 패턴을 분석하여 맞춤형 지침을 개선하기
레딧 사용자가 주관적인 어조 설명에 의존하기보다는 구두점 회피와 비유 출처와 같은 구체적인 패턴을 식별하기 위해 클로드가 10개의 글쓰기 샘플을 분석하도록 하는 방법을 통해 더 효과적인 맞춤 지침을 만드는 방법을 설명했습니다.

Anthropic, Claude AI 무료 공식 학습 플랫폼 출시
Anthropic은 Claude 기초, API 통합, 에이전트 기술 및 다양한 사용자 그룹을 위한 전문 트랙을 다루는 구조화된 과정을 포함한 무료 학습 플랫폼을 출시했습니다.