Qwen 3.6-35B-A3B KV 캐시 벤치마크: M5 Max에서 f16 vs q8_0 vs Turbo3 vs Turbo4, 최대 1M 컨텍스트

✍️ OpenClawRadar📅 게시일: April 28, 2026🔗 Source
Qwen 3.6-35B-A3B KV 캐시 벤치마크: M5 Max에서 f16 vs q8_0 vs Turbo3 vs Turbo4, 최대 1M 컨텍스트
Ad

한 Reddit 사용자가 Qwen 3.6-35B-A3B Q8을 TheTom의 TurboQuant Metal 포크(GitHub: TheTom/llama-cpp-turboquant, 브랜치 feature/turboquant-kv-cache)를 사용하여 128GB 통합 메모리를 장착한 MacBook Pro M5 Max에서 심층 스윕을 실행했습니다. 0부터 1M 컨텍스트 토큰까지 f16, q8_0, turbo3(3비트), turbo4(4비트)의 네 가지 KV 캐시 유형(대칭형 K 및 V, flash-attn 켜짐, mlock 켜짐)을 테스트했습니다.

하드웨어 및 빌드

M5 Max, 128GB 통합 메모리. cmake -B build -DGGML_METAL=ON으로 빌드. llama-bench 사용, 셀당 3회 반복, flash-attn 켜짐, mlock 켜짐. 야간에 8시간 벽시계 시간 소요.

생성 처리량 (tok/s)

깊이f16q8_0turbo3turbo4
089.487.479.579.7
8K84.279.272.271.2
32K72.667.861.561.8
128K44.440.736.037.7
256KOOM26.622.925.5
512KOOMOOM13.316.0
1MOOMOOM6.5OOM
Ad

프롬프트 처리 처리량 (tok/s)

깊이f16q8_0turbo3turbo4
02962294829042854
8K2098162316531439
32K1063802784678
128K321245253206
256KOOM124128101
512KOOMOOM6656
1MOOMOOM30OOM

주요 시사점

  • 깊이 0에서 f16이 프리필에서 약간 앞서며 turbo3는 디코드에서 약 10% 느림.
  • 128K에서 turbo3 프리필(253 tok/s)은 q8_0(245 tok/s)과 일치함 — 더 작은 캐시로 대역폭 압력 감소.
  • 256K에서 turbo3가 프리필에서 turbo4보다 +27% 우세(128 대 101)하지만, 디코드에서는 turbo4가 +11% 우세(25.5 대 22.9). 512K에서는 디코드 격차가 +20%로 벌어짐(turbo4 16.0 대 turbo3 13.3).
  • turbo3만이 1M 컨텍스트에 맞는 유일한 캐시 유형임(6.5 tok/s 디코드). 1M에서 메모리: 약 89GB(가중치 37GB, KV 캐시 약 52GB).

워크로드 권장 사항

  • 코딩 에이전트(깊은 컨텍스트, 많은 생성 토큰): turbo4
  • RAG / 배치 QA(무거운 프리필, 짧은 답변): turbo3
  • 1M 컨텍스트: turbo3만
  • 짧은 대화형(<32K): f16(가능한 경우) 또는 q8_0

주의사항

이는 단일 M5 Max 기준입니다. 메모리 대역폭과 GPU 코어에 따라 교차점이 변경될 수 있습니다. 대칭형 K/V만 테스트되었습니다. 비대칭 조합(예: -ctk q8_0 -ctv turbo4)은 벤치마크되지 않았습니다. TheTom의 포크는 연구 수준이며 llama.cpp 메인에 업스트림되지 않았습니다.

📖 전체 출처 읽기: r/LocalLLaMA

Ad

👀 See Also

Claude Code 2.1.84는 범용 에이전트 프롬프트와 PowerShell 도구를 추가하고 중복 프롬프트를 제거했습니다.
News

Claude Code 2.1.84는 범용 에이전트 프롬프트와 PowerShell 도구를 추가하고 중복 프롬프트를 제거했습니다.

Claude Code 2.1.84는 코드베이스 작업을 위한 새로운 범용 서브에이전트 프롬프트와 슬립 명령어 회피 지침이 포함된 PowerShell 도구 설명을 도입했습니다. 이 업데이트에서는 아홉 개의 중복 프롬프트가 제거되고 여러 도구 설명이 단순화되었습니다.

OpenClawRadar
주간 멀티모달 AI 뉴스: 홀로트론-12B, 네모트론 옴니, 글리프프린터 등
News

주간 멀티모달 AI 뉴스: 홀로트론-12B, 네모트론 옴니, 글리프프린터 등

이번 주의 멀티모달 AI 하이라이트에는 컴퓨터 사용 작업을 위한 Holotron-12B, 언어+비전+음성을 통합한 NVIDIA의 Nemotron Omni 모델, 이미지 생성에서 정확한 텍스트 렌더링을 위한 GlyphPrinter, 비디오 향상, 3D 세분화 및 다중 에이전트 시스템을 위한 여러 오픈소스 프로젝트가 포함됩니다.

OpenClawRadar
Claude Code v2.1.133: worktree.baseRef 되돌리기, 샌드박스 경로, MCP OAuth 프록시 수정
News

Claude Code v2.1.133: worktree.baseRef 되돌리기, 샌드박스 경로, MCP OAuth 프록시 수정

Anthropic이 새로운 worktree.baseRef 설정(기본값 fresh, origin/default에서 브랜치 생성), sandbox.bwrapPath 및 sandbox.socatPath(사용자 정의 bubblewrap/socat 바이너리 경로), MCP OAuth 흐름의 프록시/mTLS 수정, 그리고 여러 버그 수정을 포함한 Claude Code CLI v2.1.133을 출시했습니다.

OpenClawRadar
클로드 코드가 앤트로픽의 프로 플랜에서 제외되어 이제 맥스 플랜에서만 이용 가능합니다.
News

클로드 코드가 앤트로픽의 프로 플랜에서 제외되어 이제 맥스 플랜에서만 이용 가능합니다.

Anthropic이 Pro 플랜($17-20/월)에서 Claude Code를 제거하여 Max 플랜($100/월부터)에서만 이용 가능하게 했습니다. Pro 플랜에는 이제 Claude Cowork, 무제한 프로젝트, Research 기능, 더 많은 Claude 모델 접근이 포함됩니다.

OpenClawRadar