Qwen3.6 27B与35B在vLLM上的调优结果:单块Radeon R9700性能测试

✍️ OpenClawRadar📅 게시일: August 9, 2026🔗 Source
Ad

r/LocalLLaMA 게시물에서 Podman을 통해 vLLM Radiance를 사용하여 단일 Radeon AI Pro R9700에서 Qwen3.6 27B(dense) 및 35B(MoE)를 실행하는 방법을 자세히 설명합니다. 작성자는 정확한 구성과 벤치마크 결과를 공유하며, 이는 AMD GPU 사용자에게 특히 유용합니다.

설정 및 주요 차이점

그들은 stilldeadcode/vllm-radiance:0.5.8 컨테이너를 사용합니다. 이 컨테이너에는 듀얼 R9700에서 텐서 병렬 처리(TP=2)를 사용하는 FP8 가중치에 맞게 조정된 참조 구성이 포함되어 있습니다. 단일 카드에 INT4 가중치를 사용하려면 다음 변경 사항이 필요합니다:

  • --tensor-parallel-size 1 (두 번째 카드 없음)
  • --gpu-memory-utilization 0.98 (참조는 0.90–0.97)
  • 27B에서 num_speculative_tokens=4 — 2/3/4/8을 사다리 테스트했으며, 4가 모든 깊이에서 8보다 17–48% 더 빠릅니다.

가중치Avesed/Qwen3.6-{27B,35B}-INT4-W4A16입니다(압축 텐서, group_size 32). FP8의 35B는 유용한 컨텍스트 길이에서 32GB 카드에 맞지 않습니다.

중요한 수정: tokenizer.json

Avesed INT4 저장소에는 truncation.max_length가 512로 설정되고 paddingFixed(512)로 설정된 tokenizer.json이 포함되어 있습니다(보정 중에 발생한 것으로 보임). 이로 인해 약 672px 이상의 비전이 깨집니다. 수정: 둘 다 null로 설정하세요.

Ad

벤치마크 결과

35B-A3B MoE (KV 풀 토큰 = 440,241)

깊이프리필 tok/s디코드 tok/s
4k~7,80061.4
16k~7,70060.1
50k~6,04057.0
78k~5,12054.7
100k~4,58052.9
150k~3,69049.5

27B dense, MTP spec=4 (KV 풀 토큰 = 212,147)

깊이프리필 tok/s디코드 tok/s평균 수락 길이
4k~1,28859.64.4
16k~1,34562.34.6
50k~1,20759.64.5
100k~1,02753.74.5

주목할 점: 35B MoE는 훨씬 더 높은 프리필 처리량(최대 7.8k tok/s 대 1.3k)을 달성하지만 디코드 속도는 비슷합니다. 27B의 MTP 추측은 평균 수락 길이 약 4.5 토큰을 제공합니다.

이것은 듀얼 GPU가 없는 AMD 사용자가 이러한 모델을 로컬에서 실행하려는 경우 실용적인 구성입니다. 작성자는 요청 시 시작 스크립트를 제공할 의향이 있습니다.

📖 전체 소스 읽기: r/LocalLLaMA

Ad

👀 See Also

오픈소스 Go 포트인 Claude Code CLI가 claw-code-go로 출시되었습니다
Tools

오픈소스 Go 포트인 Claude Code CLI가 claw-code-go로 출시되었습니다

개발자 dolm09이 최근 유출된 내용을 기반으로 Claude Code CLI의 완전한 Go 포트인 claw-code-go를 공개했습니다. 이 프로젝트는 약 10,000줄의 코드로 구성되어 있으며 단일 자체 포함 실행 가능 바이너리를 생성합니다.

OpenClawRadar
코드북 무손실 LLM 압축: 비트 단위 패킹으로 10-25% RAM 감소 달성
Tools

코드북 무손실 LLM 압축: 비트 단위 패킹으로 10-25% RAM 감소 달성

개발자가 무손실 LLM 압축을 위한 개념 증명 코드를 공개했습니다. 이 코드는 fp16 가중치를 블록으로 패킹하여 10-25%의 RAM 감소를 달성하지만, 추론 속도가 약 절반으로 느려지는 트레이드오프가 있습니다. 이 접근법은 fp16이 16비트 표현을 사용함에도 불구하고 대부분의 모델이 실제로는 12-13비트의 고유 값만 사용한다는 점을 확인했습니다.

OpenClawRadar
Intuno: AI 에이전트 발견 및 통신을 위한 오픈 소스 네트워크
Tools

Intuno: AI 에이전트 발견 및 통신을 위한 오픈 소스 네트워크

Intuno는 AI 에이전트가 기능을 등록하고, 의미론적 검색을 통해 서로를 발견하며, 3줄의 Python 코드로 함수를 호출할 수 있는 오픈소스 네트워크입니다. Claude Desktop 또는 Cursor에서 사용할 수 있는 MCP 통합을 포함하고 있습니다.

OpenClawRadar
AlterSpec v1.0: AI 에이전트를 위한 런타임 정책 시행
Tools

AlterSpec v1.0: AI 에이전트를 위한 런타임 정책 시행

AlterSpec v1.0는 AI 에이전트와 도구 사이에 위치한 오픈소스 런타임 강제 실행 엔진으로, 실행 전에 YAML로 정의된 정책에 따라 동작을 평가합니다. 허용/거부/검토 결정, 암호화된 정책 서명, 감사 로깅 기능을 제공합니다.

OpenClawRadar