Qwen3.6 27B与35B在vLLM上的调优结果:单块Radeon R9700性能测试
r/LocalLLaMA 게시물에서 Podman을 통해 vLLM Radiance를 사용하여 단일 Radeon AI Pro R9700에서 Qwen3.6 27B(dense) 및 35B(MoE)를 실행하는 방법을 자세히 설명합니다. 작성자는 정확한 구성과 벤치마크 결과를 공유하며, 이는 AMD GPU 사용자에게 특히 유용합니다.
설정 및 주요 차이점
그들은 stilldeadcode/vllm-radiance:0.5.8 컨테이너를 사용합니다. 이 컨테이너에는 듀얼 R9700에서 텐서 병렬 처리(TP=2)를 사용하는 FP8 가중치에 맞게 조정된 참조 구성이 포함되어 있습니다. 단일 카드에 INT4 가중치를 사용하려면 다음 변경 사항이 필요합니다:
--tensor-parallel-size 1(두 번째 카드 없음)--gpu-memory-utilization 0.98(참조는 0.90–0.97)- 27B에서
num_speculative_tokens=4— 2/3/4/8을 사다리 테스트했으며, 4가 모든 깊이에서 8보다 17–48% 더 빠릅니다.
가중치는 Avesed/Qwen3.6-{27B,35B}-INT4-W4A16입니다(압축 텐서, group_size 32). FP8의 35B는 유용한 컨텍스트 길이에서 32GB 카드에 맞지 않습니다.
중요한 수정: tokenizer.json
Avesed INT4 저장소에는 truncation.max_length가 512로 설정되고 padding이 Fixed(512)로 설정된 tokenizer.json이 포함되어 있습니다(보정 중에 발생한 것으로 보임). 이로 인해 약 672px 이상의 비전이 깨집니다. 수정: 둘 다 null로 설정하세요.
벤치마크 결과
35B-A3B MoE (KV 풀 토큰 = 440,241)
| 깊이 | 프리필 tok/s | 디코드 tok/s |
|---|---|---|
| 4k | ~7,800 | 61.4 |
| 16k | ~7,700 | 60.1 |
| 50k | ~6,040 | 57.0 |
| 78k | ~5,120 | 54.7 |
| 100k | ~4,580 | 52.9 |
| 150k | ~3,690 | 49.5 |
27B dense, MTP spec=4 (KV 풀 토큰 = 212,147)
| 깊이 | 프리필 tok/s | 디코드 tok/s | 평균 수락 길이 |
|---|---|---|---|
| 4k | ~1,288 | 59.6 | 4.4 |
| 16k | ~1,345 | 62.3 | 4.6 |
| 50k | ~1,207 | 59.6 | 4.5 |
| 100k | ~1,027 | 53.7 | 4.5 |
주목할 점: 35B MoE는 훨씬 더 높은 프리필 처리량(최대 7.8k tok/s 대 1.3k)을 달성하지만 디코드 속도는 비슷합니다. 27B의 MTP 추측은 평균 수락 길이 약 4.5 토큰을 제공합니다.
이것은 듀얼 GPU가 없는 AMD 사용자가 이러한 모델을 로컬에서 실행하려는 경우 실용적인 구성입니다. 작성자는 요청 시 시작 스크립트를 제공할 의향이 있습니다.
📖 전체 소스 읽기: r/LocalLLaMA
👀 See Also

오픈소스 Go 포트인 Claude Code CLI가 claw-code-go로 출시되었습니다
개발자 dolm09이 최근 유출된 내용을 기반으로 Claude Code CLI의 완전한 Go 포트인 claw-code-go를 공개했습니다. 이 프로젝트는 약 10,000줄의 코드로 구성되어 있으며 단일 자체 포함 실행 가능 바이너리를 생성합니다.

코드북 무손실 LLM 압축: 비트 단위 패킹으로 10-25% RAM 감소 달성
개발자가 무손실 LLM 압축을 위한 개념 증명 코드를 공개했습니다. 이 코드는 fp16 가중치를 블록으로 패킹하여 10-25%의 RAM 감소를 달성하지만, 추론 속도가 약 절반으로 느려지는 트레이드오프가 있습니다. 이 접근법은 fp16이 16비트 표현을 사용함에도 불구하고 대부분의 모델이 실제로는 12-13비트의 고유 값만 사용한다는 점을 확인했습니다.

Intuno: AI 에이전트 발견 및 통신을 위한 오픈 소스 네트워크
Intuno는 AI 에이전트가 기능을 등록하고, 의미론적 검색을 통해 서로를 발견하며, 3줄의 Python 코드로 함수를 호출할 수 있는 오픈소스 네트워크입니다. Claude Desktop 또는 Cursor에서 사용할 수 있는 MCP 통합을 포함하고 있습니다.

AlterSpec v1.0: AI 에이전트를 위한 런타임 정책 시행
AlterSpec v1.0는 AI 에이전트와 도구 사이에 위치한 오픈소스 런타임 강제 실행 엔진으로, 실행 전에 YAML로 정의된 정책에 따라 동작을 평가합니다. 허용/거부/검토 결정, 암호화된 정책 서명, 감사 로깅 기능을 제공합니다.