Qwen 3.6-35B-A3B KV 캐시 벤치마크: M5 Max에서 f16 vs q8_0 vs Turbo3 vs Turbo4, 최대 1M 컨텍스트

✍️ OpenClawRadar📅 게시일: April 28, 2026🔗 Source
Qwen 3.6-35B-A3B KV 캐시 벤치마크: M5 Max에서 f16 vs q8_0 vs Turbo3 vs Turbo4, 최대 1M 컨텍스트
Ad

한 Reddit 사용자가 Qwen 3.6-35B-A3B Q8을 TheTom의 TurboQuant Metal 포크(GitHub: TheTom/llama-cpp-turboquant, 브랜치 feature/turboquant-kv-cache)를 사용하여 128GB 통합 메모리를 장착한 MacBook Pro M5 Max에서 심층 스윕을 실행했습니다. 0부터 1M 컨텍스트 토큰까지 f16, q8_0, turbo3(3비트), turbo4(4비트)의 네 가지 KV 캐시 유형(대칭형 K 및 V, flash-attn 켜짐, mlock 켜짐)을 테스트했습니다.

하드웨어 및 빌드

M5 Max, 128GB 통합 메모리. cmake -B build -DGGML_METAL=ON으로 빌드. llama-bench 사용, 셀당 3회 반복, flash-attn 켜짐, mlock 켜짐. 야간에 8시간 벽시계 시간 소요.

생성 처리량 (tok/s)

깊이f16q8_0turbo3turbo4
089.487.479.579.7
8K84.279.272.271.2
32K72.667.861.561.8
128K44.440.736.037.7
256KOOM26.622.925.5
512KOOMOOM13.316.0
1MOOMOOM6.5OOM
Ad

프롬프트 처리 처리량 (tok/s)

깊이f16q8_0turbo3turbo4
02962294829042854
8K2098162316531439
32K1063802784678
128K321245253206
256KOOM124128101
512KOOMOOM6656
1MOOMOOM30OOM

주요 시사점

  • 깊이 0에서 f16이 프리필에서 약간 앞서며 turbo3는 디코드에서 약 10% 느림.
  • 128K에서 turbo3 프리필(253 tok/s)은 q8_0(245 tok/s)과 일치함 — 더 작은 캐시로 대역폭 압력 감소.
  • 256K에서 turbo3가 프리필에서 turbo4보다 +27% 우세(128 대 101)하지만, 디코드에서는 turbo4가 +11% 우세(25.5 대 22.9). 512K에서는 디코드 격차가 +20%로 벌어짐(turbo4 16.0 대 turbo3 13.3).
  • turbo3만이 1M 컨텍스트에 맞는 유일한 캐시 유형임(6.5 tok/s 디코드). 1M에서 메모리: 약 89GB(가중치 37GB, KV 캐시 약 52GB).

워크로드 권장 사항

  • 코딩 에이전트(깊은 컨텍스트, 많은 생성 토큰): turbo4
  • RAG / 배치 QA(무거운 프리필, 짧은 답변): turbo3
  • 1M 컨텍스트: turbo3만
  • 짧은 대화형(<32K): f16(가능한 경우) 또는 q8_0

주의사항

이는 단일 M5 Max 기준입니다. 메모리 대역폭과 GPU 코어에 따라 교차점이 변경될 수 있습니다. 대칭형 K/V만 테스트되었습니다. 비대칭 조합(예: -ctk q8_0 -ctv turbo4)은 벤치마크되지 않았습니다. TheTom의 포크는 연구 수준이며 llama.cpp 메인에 업스트림되지 않았습니다.

📖 전체 출처 읽기: r/LocalLLaMA

Ad

👀 See Also

Claude Code v2.1.200: 주요 수정 사항 및 권한 모드 변경
News

Claude Code v2.1.200: 주요 수정 사항 및 권한 모드 변경

Claude Code v2.1.200은 AskUserQuestion 대화 상자가 더 이상 자동으로 계속되지 않도록 변경하고, 기본 권한 모드를 수동으로 전환하며, 백그라운드 에이전트 충돌 및 명단 손상을 수정합니다.

OpenClawRadar
AWS Bedrock, 클로드 오퍼스 4.7 할당량을 조용히 제거: 프로덕션 AI 워크플로우에 대한 경고
News

AWS Bedrock, 클로드 오퍼스 4.7 할당량을 조용히 제거: 프로덕션 AI 워크플로우에 대한 경고

한 HN 사용자가 AWS Bedrock이 경고 없이 Claude Opus 4.7 할당량을 0으로 설정했다고 보고했습니다. AWS 지원팀은 시스템 업데이트 때문이며 복원을 보장할 수 없다고 확인했습니다. 사용자들은 Opus 4.6으로 마이그레이션하거나 제공자를 전환하라는 조언을 받고 있습니다.

OpenClawRadar
비영리 단체, 팀 및 엔터프라이즈 플랜에서 Claude Opus 4.6 이용 가능
News

비영리 단체, 팀 및 엔터프라이즈 플랜에서 Claude Opus 4.6 이용 가능

팀 및 엔터프라이즈 플랜을 사용하는 비영리 단체는 이제 추가 비용 없이 Anthropic의 최신 AI 모델인 Claude Opus 4.6에 접근할 수 있습니다.

OpenClawRadar
클로드 데스크톱 vs 클로드 코드: 시스템 프롬프트 차이가 AI 행동에 미치는 영향
News

클로드 데스크톱 vs 클로드 코드: 시스템 프롬프트 차이가 AI 행동에 미치는 영향

사용자가 동일한 Claude Opus 모델, 계정, 설정을 사용함에도 Claude Desktop과 Claude Code 간에 상당한 행동 차이를 보고합니다. 이러한 차이에는 반사적 동의, 요청하지 않은 웰빙 조언, Desktop에서 나타나지만 Code에서는 발생하지 않는 비즈니스 중심 프레이밍 등이 포함됩니다.

OpenClawRadar