Qwen3.6 27B与35B在vLLM上的调优结果:单块Radeon R9700性能测试
r/LocalLLaMA 게시물에서 Podman을 통해 vLLM Radiance를 사용하여 단일 Radeon AI Pro R9700에서 Qwen3.6 27B(dense) 및 35B(MoE)를 실행하는 방법을 자세히 설명합니다. 작성자는 정확한 구성과 벤치마크 결과를 공유하며, 이는 AMD GPU 사용자에게 특히 유용합니다.
설정 및 주요 차이점
그들은 stilldeadcode/vllm-radiance:0.5.8 컨테이너를 사용합니다. 이 컨테이너에는 듀얼 R9700에서 텐서 병렬 처리(TP=2)를 사용하는 FP8 가중치에 맞게 조정된 참조 구성이 포함되어 있습니다. 단일 카드에 INT4 가중치를 사용하려면 다음 변경 사항이 필요합니다:
--tensor-parallel-size 1(두 번째 카드 없음)--gpu-memory-utilization 0.98(참조는 0.90–0.97)- 27B에서
num_speculative_tokens=4— 2/3/4/8을 사다리 테스트했으며, 4가 모든 깊이에서 8보다 17–48% 더 빠릅니다.
가중치는 Avesed/Qwen3.6-{27B,35B}-INT4-W4A16입니다(압축 텐서, group_size 32). FP8의 35B는 유용한 컨텍스트 길이에서 32GB 카드에 맞지 않습니다.
중요한 수정: tokenizer.json
Avesed INT4 저장소에는 truncation.max_length가 512로 설정되고 padding이 Fixed(512)로 설정된 tokenizer.json이 포함되어 있습니다(보정 중에 발생한 것으로 보임). 이로 인해 약 672px 이상의 비전이 깨집니다. 수정: 둘 다 null로 설정하세요.
벤치마크 결과
35B-A3B MoE (KV 풀 토큰 = 440,241)
| 깊이 | 프리필 tok/s | 디코드 tok/s |
|---|---|---|
| 4k | ~7,800 | 61.4 |
| 16k | ~7,700 | 60.1 |
| 50k | ~6,040 | 57.0 |
| 78k | ~5,120 | 54.7 |
| 100k | ~4,580 | 52.9 |
| 150k | ~3,690 | 49.5 |
27B dense, MTP spec=4 (KV 풀 토큰 = 212,147)
| 깊이 | 프리필 tok/s | 디코드 tok/s | 평균 수락 길이 |
|---|---|---|---|
| 4k | ~1,288 | 59.6 | 4.4 |
| 16k | ~1,345 | 62.3 | 4.6 |
| 50k | ~1,207 | 59.6 | 4.5 |
| 100k | ~1,027 | 53.7 | 4.5 |
주목할 점: 35B MoE는 훨씬 더 높은 프리필 처리량(최대 7.8k tok/s 대 1.3k)을 달성하지만 디코드 속도는 비슷합니다. 27B의 MTP 추측은 평균 수락 길이 약 4.5 토큰을 제공합니다.
이것은 듀얼 GPU가 없는 AMD 사용자가 이러한 모델을 로컬에서 실행하려는 경우 실용적인 구성입니다. 작성자는 요청 시 시작 스크립트를 제공할 의향이 있습니다.
📖 전체 소스 읽기: r/LocalLLaMA
👀 See Also

CK 검색: MCP 서버 통합을 갖춘 로컬 의미론적 검색 도구
CK Search는 클라우드 의존성 없이 텍스트 디렉토리를 인덱싱하는 로컬 시맨틱 검색 도구로, 내장 MCP 서버를 포함하고 있습니다. 이 도구는 MCP를 통해 AI 에이전트가 사용할 수 있으며, 소스는 grep과 비교한 설정, 장점, 한계를 다루는 실용적인 가이드를 제공합니다.

작은 봇으로 AI 탐험하기: 나노봇 튜터를 통한 AI 에이전트 이해하기
OpenClaw 커뮤니티 구성원이 AI 에이전트 기능을 명확히 설명하기 위한 소형 프레임워크인 '나노봇 튜터'에 대한 통찰을 공유합니다. 이 컴팩트한 학습 환경에 몰입함으로써 지능형 에이전트의 작동 방식을 밝혀내는 방법을 알아보세요.

클로드 코드 루틴: AI 개발 워크플로우를 위한 자동화된 클라우드 작업
Claude Code 루틴은 개발자가 Claude Code 구성을 Anthropic이 관리하는 클라우드 인프라에서 실행되는 자동화된 작업으로 저장할 수 있게 합니다. 루틴은 저장소에 대한 프롬프트의 무인 실행을 위해 예약, API, GitHub 트리거를 지원합니다.

Skill Seekers v3.2.0은 Claude 스킬을 위한 YouTube 튜토리얼 추출 기능을 추가합니다.
Skill Seekers v3.2.0는 이제 YouTube 튜토리얼에서 콘텐츠를 추출하여 Claude용으로 구조화된 SKILL.md 파일을 생성합니다. 이 도구는 2단계 AI 향상 워크플로우를 사용하여 OCR 출력을 정리하고 비디오 콘텐츠에서 사용 가능한 문서를 생성합니다.