Qwen 3.6 27B: AMD MI50에서 52.8 tps TG, 전체 정밀도, MTP 없음, 양자화 없음

✍️ OpenClawRadar📅 게시일: May 14, 2026🔗 Source
Qwen 3.6 27B: AMD MI50에서 52.8 tps TG, 전체 정밀도, MTP 없음, 양자화 없음
Ad

Reddit 사용자가 8개의 AMD MI50(2018년 GPU)에서 커스텀 vllm 포크를 사용하여 Qwen3.6-27B(전체 정밀도, 양자화 없음)를 실행한 벤치마크 결과를 게시했습니다. 이 시스템은 TP8, MTP 없음, 큰 프롬프트를 느리게 할 수 있는 플래시 어텐션 최적화 없이 텍스트 생성 시 초당 52.8 토큰(tps), 프롬프트 처리 시 초당 1569 tps를 달성합니다.

주요 세부 사항

  • 하드웨어: 8x AMD MI50, PCIe(아직 PCIe 스위치 미사용)
  • 엔진: ROCm 7.2.1이 포함된 vllm 포크 v0.20.1 – github.com/ai-infos/vllm-gfx906-mobydick
  • 모델: Qwen/Qwen3.6-27B(HuggingFace 전체 정밀도 FP16)
  • 양자화: 없음 – 전체 FP16 정밀도
  • MTP: 비활성화(큰 프롬프트에서 더 느림)
  • 플래시 어텐션: 사용 안 함(triton 기반 AMD 플래시 어텐션도 큰 프롬프트에서 느림)
  • 프롬프트: 1K 및 15K 토큰 프롬프트로 단일 추론(벤치마크는 10K 입력, 1K 출력 사용)

벤치마크 결과

성공적인 요청: 4
총 입력 토큰: 40000
총 생성 토큰: 4000
출력 토큰 처리량(tok/s): 32.91
최대 출력 토큰 처리량(tok/s): 56.00
총 토큰 처리량(tok/s): 362.03
평균 TTFT(ms): 32874.56
평균 TPOT(ms): 88.66
평균 ITL(ms): 88.66

참고: 사용자는 15K 프롬프트의 단일 추론에서 52.8 tps TG를 보고합니다. 벤치마크는 각각 10K 입력의 4개 요청에 대한 집계 결과를 보여줍니다. TP2를 사용하면 모델도 맞고 약 34 tps TG로 실행됩니다.

Ad

설정 명령어(Docker + vllm serve)

docker run -it --name vllm-gfx906-mobydick \
  -v /llm:/llm --network host \
  --device=/dev/kfd --device=/dev/dri \
  --group-add video --group-add $(getent group render | cut -d: -f3) \
  --ipc=host \
  aiinfos/vllm-gfx906-mobydick:v0.20.1rc0.x-rocm7.2.1-pytorch2.11.0 \
  FLASH_ATTENTION_TRITON_AMD_ENABLE="TRUE" VLLM_LOGGING_LEVEL=DEBUG vllm serve \
  /llm/models/Qwen3.6-27B \
  --served-model-name Qwen3.6-27B \
  --dtype float16 \
  --max-model-len auto \
  --max-num-batched-tokens 8192 \
  --block-size 64 \
  --gpu-memory-utilization 0.98 \
  --enable-auto-tool-choice \
  --tool-call-parser qwen3_coder \
  --reasoning-parser qwen3 \
  --mm-processor-cache-gb 1 \
  --limit-mm-per-prompt.image 1 --limit-mm-per-prompt.video 1 \
  --skip-mm-profiling \
  --default-chat-template-kwargs '{"min_p": 0.0, "presence_penalty": 0.0, "repetition_penalty": 1.0}' \
  --tensor-parallel-size 8 \
  --host 0.0.0.0 --port 8000 2>&1 | tee log.txt

대상 사용자

AMD 하드웨어에서 에이전트 코딩 도구(예: Claude Code, Hermes)를 실행하는 개발자, 특히 큰 프롬프트와 전체 정밀도를 요구하는 경우.

사용자는 PCIe 스위치(지연 시간 감소), ROCm/gfx906에 최적화된 플래시 어텐션/MTP, 업데이트된 소프트웨어 스택을 통해 추가 개선이 가능하다고 언급합니다.

📖 전체 출처 읽기: r/LocalLLaMA

Ad

👀 See Also

ThermoQA: 열역학 공학 문제 293개 계산 문제로 LLM 성능을 평가하는 공개 벤치마크
News

ThermoQA: 열역학 공학 문제 293개 계산 문제로 LLM 성능을 평가하는 공개 벤치마크

ThermoQA는 3단계에 걸친 293개의 공학 열역학 문제로 구성된 오픈 벤치마크로, LLM의 정확한 수치 계산 능력을 테스트합니다. Claude Opus 4.6이 94.1%의 종합 점수로 선두를 달리고 있으며, DeepSeek-R1은 ±2.5%로 실행 간 변동성이 가장 높습니다.

OpenClawRadar
모두가 AI를 가지고 있지만 회사가 여전히 아무것도 배우지 못할 때: 기업 AI 도입의 혼란스러운 중간 지점
News

모두가 AI를 가지고 있지만 회사가 여전히 아무것도 배우지 못할 때: 기업 AI 도입의 혼란스러운 중간 지점

Ethan Mollick의 프레임워크는 개인의 AI 생산성 향상이 자동으로 조직 학습으로 이어지지 않음을 보여줍니다. 이 기사는 AI 사용이 불균일하고, 숨겨져 있으며, 공유된 지식과 단절된 '혼란스러운 중간 지점'에 기업이 머물러 있는 이유를 탐구합니다.

OpenClawRadar
🦀
News

Claude Code v2.1.268: 서드파티 엔드포인트의 HTTP 400 오류, WebFetch 멈춤, 시크릿 유출 문제 수정

Claude Code v2.1.268이 HTTP 400 오류를 수정하고, ANTHROPIC_BASE_URL 엔드포인트에서 2.1.265 이후 발생하던 모든 턴 실패를 해결했으며, 300초 WebFetch 데드라인을 추가하고 플러그인 및 MCP 오류로 인한 토큰 유출을 차단합니다.

OpenClawRadar
Qwen3.6 27B FP8, RTX 5000 PRO 48GB에서 BF16 KV 캐시 20만 토큰을 80 TPS로 실행
News

Qwen3.6 27B FP8, RTX 5000 PRO 48GB에서 BF16 KV 캐시 20만 토큰을 80 TPS로 실행

Reddit 사용자가 Qwen3.6 27B FP8 모델을 BF16 KV 캐시와 함께 200k 토큰으로 설정하여 단일 RTX 5000 PRO 48GB GPU에서 60-90 TPS를 달성한 방법을 공유합니다. 전체 환경 변수, 설정 및 벤치마크 결과가 제공됩니다.

OpenClawRadar