Qwen KV 캐시 양자화 심층 분석: PPL, KL 발산 및 비대칭 K/V 결과

✍️ OpenClawRadar📅 게시일: April 29, 2026🔗 Source
Qwen KV 캐시 양자화 심층 분석: PPL, KL 발산 및 비대칭 K/V 결과
Ad

M5 Max에서 TheTom TurboQuant 포크(feature/turboquant-kv-cache)를 사용한 Qwen 3.6-35B-A3B Q8의 KV 캐시 양자화 후속 벤치마크입니다. 이번 라운드는 perplexity, KL divergence, 비대칭 K/V 조합, 그리고 64K 깊이 데이터 포인트를 다룹니다.

품질 결과 (Perplexity + KL Divergence)

Context 크기 4096, wikitext-2 기준. f16을 logits의 기준선으로 사용했습니다.

  • q8_0: PPL 5.7433, KL 0.0016, top-1 토큰 일치율 98.64% — 4K 컨텍스트에서 실질적으로 무료(PPL 차이 -0.0005, ±0.036 stderr 이내).
  • turbo3 (~4.9x): PPL 5.8092, KL 0.0199, top-1 일치율 93.93% — PPL 약 1% 증가, 토큰 불일치 5%p.
  • turbo4 (~3.8x): PPL 5.7810, KL 0.0131, top-1 일치율 95.28% — q8_0과 turbo3 사이에 위치하며, 압축률과 일관됨.

품질 비용은 압축률에 비례하며, 특이점은 없습니다.

비대칭 K/V 스윕

llama-bench로 디코드 tok/s 측정, 대칭 스윕과 동일한 플래그 사용. 주요 설정:

  • -ctk q8_0 -ctv turbo4가 눈에 띕니다: 256K에서 대칭 q8_0 처리량과 일치(27.1 vs 26.6 tg), 대칭 q8_0이 OOM되는 512K에 적합. q8_0급 프리필과 turbo4급 컨텍스트 상한을 제공합니다.
  • -ctk q8_0 -ctv turbo3: 유사한 트릭이지만 디코드 성능이 더 나쁩니다(V 양자화가 더 타이트하여 생성 속도 저하).
  • -ctk f16 -ctv turbo4: Metal에서 작동 불가 — FlashAttention 커널이 이 조합을 빠르게 처리하지 못하고 일반 디퀀트-어텐션으로 폴백됩니다. 8K에서는 대칭 f16보다 34배 느리고, 128K에서는 78배 느립니다(4.1 t/s pp). 사용하지 마십시오.

깊이 128K에서 샘플 디코드 tok/s: q8_0 K/turbo4 V 41.0, q8_0 K/turbo3 V 38.2, f16 K/turbo4 V 2.8.

Ad

64K 깊이 행

깊이 65536에서 모든 7개 설정(pp512 / tg128 tok/s):

  • f16 대칭: 602.0 / 59.8
  • q8_0 대칭: 479.2 / 57.9
  • turbo3 대칭: 469.8 / 49.9
  • turbo4 대칭: 418.0 / 55.2
  • q8_0 K / turbo4 V: 468.2 / 55.9
  • q8_0 K / turbo3 V: 465.6 / 52.6
  • f16 K / turbo4 V: 8.3 / 4.9

프리필 곡선은 64K에서 거의 수렴했습니다: turbo3(470)이 q8_0(479)의 2% 이내. 대역폭 제한 영역은 64K와 128K 사이에서 시작됩니다.

업데이트된 권장 사항

코딩 에이전트(깊은 컨텍스트, 많은 생성 토큰)의 경우: -ctk q8_0 -ctv turbo4를 사용하세요. K에서는 q8_0 품질, V에서는 turbo4 절감, 512K에 적합. RAG 또는 배치 QA(무거운 프리필, 작은 디코드)의 경우 대칭 q8_0 또는 turbo4도 여전히 실행 가능합니다.

📖 전체 소스 읽기: r/LocalLLaMA

Ad

👀 See Also

하나의 데모에서 두 가지 AI 실패: Claude 코드가 스키마 오류 대신 철자 수정, OpenAI가 사용자 정의 필드 매핑 오류
News

하나의 데모에서 두 가지 AI 실패: Claude 코드가 스키마 오류 대신 철자 수정, OpenAI가 사용자 정의 필드 매핑 오류

라이브 워크숍에서 Claude Code가 JSON 스키마 유효성 검사 오류를 무시하고 철자 경고를 수정했고, OpenAI는 이상한 사용자 정의 Salesforce 필드를 매핑하려는 첫 번째 시도에서 쓰레기를 반환했습니다.

OpenClawRadar
🦀
News

일상적인 위험: AI 안전성의 가장 큰 위협은 극적이지 않고 지루한 것이다

한 에세이는 평범한 AI 실패가 이미 대규모 피해를 일으키고 있으며, 현재의 정렬 접근법은 샌드박스 환경에 지나치게 의존하고 있으며, 능력 수렴으로 인해 의도치 않은 오픈월드 노출이 점점 더 현실화되고 있다고 주장합니다.

OpenClawRadar
Claude Code v2.1.198: Chrome GA, 에이전트 알림, /dataviz 및 AWS 게이트웨이
News

Claude Code v2.1.198: Chrome GA, 에이전트 알림, /dataviz 및 AWS 게이트웨이

Anthropic이 Chrome 확장 프로그램 GA, 에이전트 알림, /dataviz 스킬, AWS Gateway 프로바이더, 네트워크 끊김 및 서브에이전트 사고 관련 수정 사항을 포함한 Claude Code v2.1.198을 출시했습니다.

OpenClawRadar
Anthropic의 새로운 Claude 구독 크레딧: 에이전트 SDK와 claude -p가 6월 15일부터 별도의 한도 풀을 얻습니다
News

Anthropic의 새로운 Claude 구독 크레딧: 에이전트 SDK와 claude -p가 6월 15일부터 별도의 한도 풀을 얻습니다

6월 15일부터 Claude 구독자는 Agent SDK와 claude -p 사용을 위한 별도의 월별 크레딧을 받게 됩니다: Max 20x 요금제는 월 $200, Max 5x는 $100, Pro는 $20입니다. 크레딧이 소진되면 추가 결제에 동의하지 않는 한 사용이 중단됩니다. 대화형 Claude Code와 채팅은 기존 구독 풀에서 사용됩니다.

OpenClawRadar