Qwen3.6 27B与35B在vLLM上的调优结果:单块Radeon R9700性能测试
r/LocalLLaMA 게시물에서 Podman을 통해 vLLM Radiance를 사용하여 단일 Radeon AI Pro R9700에서 Qwen3.6 27B(dense) 및 35B(MoE)를 실행하는 방법을 자세히 설명합니다. 작성자는 정확한 구성과 벤치마크 결과를 공유하며, 이는 AMD GPU 사용자에게 특히 유용합니다.
설정 및 주요 차이점
그들은 stilldeadcode/vllm-radiance:0.5.8 컨테이너를 사용합니다. 이 컨테이너에는 듀얼 R9700에서 텐서 병렬 처리(TP=2)를 사용하는 FP8 가중치에 맞게 조정된 참조 구성이 포함되어 있습니다. 단일 카드에 INT4 가중치를 사용하려면 다음 변경 사항이 필요합니다:
--tensor-parallel-size 1(두 번째 카드 없음)--gpu-memory-utilization 0.98(참조는 0.90–0.97)- 27B에서
num_speculative_tokens=4— 2/3/4/8을 사다리 테스트했으며, 4가 모든 깊이에서 8보다 17–48% 더 빠릅니다.
가중치는 Avesed/Qwen3.6-{27B,35B}-INT4-W4A16입니다(압축 텐서, group_size 32). FP8의 35B는 유용한 컨텍스트 길이에서 32GB 카드에 맞지 않습니다.
중요한 수정: tokenizer.json
Avesed INT4 저장소에는 truncation.max_length가 512로 설정되고 padding이 Fixed(512)로 설정된 tokenizer.json이 포함되어 있습니다(보정 중에 발생한 것으로 보임). 이로 인해 약 672px 이상의 비전이 깨집니다. 수정: 둘 다 null로 설정하세요.
벤치마크 결과
35B-A3B MoE (KV 풀 토큰 = 440,241)
| 깊이 | 프리필 tok/s | 디코드 tok/s |
|---|---|---|
| 4k | ~7,800 | 61.4 |
| 16k | ~7,700 | 60.1 |
| 50k | ~6,040 | 57.0 |
| 78k | ~5,120 | 54.7 |
| 100k | ~4,580 | 52.9 |
| 150k | ~3,690 | 49.5 |
27B dense, MTP spec=4 (KV 풀 토큰 = 212,147)
| 깊이 | 프리필 tok/s | 디코드 tok/s | 평균 수락 길이 |
|---|---|---|---|
| 4k | ~1,288 | 59.6 | 4.4 |
| 16k | ~1,345 | 62.3 | 4.6 |
| 50k | ~1,207 | 59.6 | 4.5 |
| 100k | ~1,027 | 53.7 | 4.5 |
주목할 점: 35B MoE는 훨씬 더 높은 프리필 처리량(최대 7.8k tok/s 대 1.3k)을 달성하지만 디코드 속도는 비슷합니다. 27B의 MTP 추측은 평균 수락 길이 약 4.5 토큰을 제공합니다.
이것은 듀얼 GPU가 없는 AMD 사용자가 이러한 모델을 로컬에서 실행하려는 경우 실용적인 구성입니다. 작성자는 요청 시 시작 스크립트를 제공할 의향이 있습니다.
📖 전체 소스 읽기: r/LocalLLaMA
👀 See Also

클로드 기반 MCP 도구, 빌드 도구 없이 대화형 HTML 컴포넌트 생성
한 개발자가 daub.dev를 구축했습니다. 이 시스템은 Claude가 MCP 서버의 두뇌 역할을 하여 자연어 설명으로부터 스타일이 적용된 대화형 HTML UI 컴포넌트를 생성합니다. React, 번들러 또는 빌드 파이프라인 없이 작동합니다.

컨텍스트 모드: Claude 코드를 위한 도구 출력 압축 MCP 서버
컨텍스트 모드는 Claude Code와 도구 출력 사이에 위치하는 MCP 서버로, 샌드박스에서 이를 처리하고 요약만 반환합니다. MCP 출력 315KB를 5.4KB로 줄여, 속도 저하가 시작되기 전 세션 시간을 약 30분에서 약 3시간으로 연장합니다.

캐스케이드 그래프: AI 에너지 제약과 공급 병목 현상의 인터랙티브 지도
캐스케이드 그래프는 물리적 경제의 방향성 지식 그래프로, 에너지 및 물리적 제약에서 투자 가능한 자산에 이르기까지 구조적 압력이 어떻게 전이되는지 추적하기 위해 405개의 노드(드라이버, 병목점, 지역, 티커)가 597개의 출처가 있는 엣지로 연결되어 있습니다.

EvalShift: 모델 마이그레이션 중 LLM 성능 저하를 감지하는 오픈소스 CLI
EvalShift는 MIT 라이선스의 Python CLI로, 프롬프트, 에이전트 및 도구 호출 워크플로에서 소스와 대상 LLM 출력을 비교하여 로컬 HTML 회귀 보고서를 생성합니다.