Qwen3.6 27B FP8, RTX 5000 PRO 48GB에서 BF16 KV 캐시 20만 토큰을 80 TPS로 실행

r/LocalLLaMA의 Reddit 사용자가 단일 RTX 5000 PRO 48GB GPU에서 Qwen3.6-27B-FP8을 BF16 KV 캐시(200k 토큰)로 실행하여 60–90 TPS를 달성했다고 보고했습니다. 이 설정은 vLLM 0.20.1, CUDA 12.9, Qwen의 공식 FP8 양자화를 사용하며, 멀티모달 및 MTP 추측 디코딩을 지원합니다.
설정 세부 사항
환경은 FlashInfer FP8 MoE, FP8 Marlin 및 비동기 스케줄링을 사용합니다. 주요 환경 변수 및 실행 명령:
export VLLM_USE_FLASHINFER_MOE_FP8=1
export VLLM_TEST_FORCE_FP8_MARLIN=1
export VLLM_SLEEP_WHEN_IDLE=1
export VLLM_MEMORY_PROFILER_ESTIMATE_CUDAGRAPHS=1
export VLLM_LOG_STATS_INTERVAL=2
export VLLM_WORKER_MULTIPROC_METHOD=spawn
export SAFETENSORS_FAST_GPU=1
export CUDA_DEVICE_ORDER=PCI_BUS_ID
export TORCH_FLOAT32_MATMUL_PRECISION=high
export PYTORCH_ALLOC_CONF=expandable_segments:True
vllm serve Qwen/Qwen3.6-27B-FP8
--host 0.0.0.0 --port 8080
--performance-mode interactivity
--trust-remote-code
--enable-auto-tool-choice
--tool-call-parser qwen3_coder
--reasoning-parser qwen3
--mm-encoder-tp-mode data
--mm-processor-cache-type shm
--gpu-memory-utilization 0.975
--speculative-config '{"method":"mtp","num_speculative_tokens":2}'
--compilation-config '{"cudagraph_mode": "FULL_AND_PIECEWISE", "max_cudagraph_capture_size": 16, "mode": "VLLM_COMPILE"}'
--async-scheduling
--attention-backend flashinfer
--max-model-len 196608
--kv-cache-dtype bfloat16
--enable-prefix-caching
성능 관찰
MTP=2 추측 디코딩을 통해 코드 생성 시 60–90 TPS를 생성합니다. BF16 KV 캐시는 양자화된 KV에서 발생하는 압축 문제를 피하여 긴 코딩 세션을 더 안정적으로 만듭니다. 사용자는 이 설정이 64GB 시스템 RAM과 적절한 CPU를 갖춘 단일 RTX 5000 PRO 48GB에서 실행되며, 로컬 LLM 개발을 위한 $10,000 워크스테이션의 강력한 후보라고 언급합니다.
대상 사용자
최소한의 양자화 아티팩트와 긴 컨텍스트 윈도우로 로컬에서 에이전트 기반 코딩 설정이 필요한 개발자.
📖 원문 보기: r/LocalLLaMA
👀 See Also

클로드 오푸스 4.6과 소넷 4.6이 이제 표준 가격으로 100만 컨텍스트를 제공합니다
Claude Opus 4.6과 Sonnet 4.6은 이제 표준 가격으로 완전한 100만 컨텍스트 창을 포함하며, 장문 컨텍스트 프리미엄 없이 요청당 최대 600개의 이미지 또는 PDF 페이지로 확장된 미디어 제한을 제공합니다.

4개월 만에 $950 MRR 달성, 클로드 코드 인텔용 MCP 서버 구축
한 명의 독립 개발자가 코드베이스 인텔리전스용 MCP 서버를 구축하여 정규직을 유지하면서 하루 8-10시간씩 작업해 4개월 만에 사용자 54명, MRR $950을 달성했습니다. 광고나 그로스 해킹 없이 Reddit과 Medium만 활용했습니다.

얀 르쿤의 AI 스타트업, 유럽 최대 시드 라운드에서 10억 달러 투자 유치
얀 르쿤의 AI 스타트업이 유럽 최대 규모의 시드 라운드로 보고된 10억 달러를 조달했습니다. 이 소식은 해커 뉴스에서 186점과 107개의 댓글과 함께 공유되었습니다.

클로드 AI, 대규모 장애 발생: 웹 UI 먹통, API 오류 증가
Claude.ai를 사용할 수 없으며, 2025년 4월 28일 19:15 UTC 기준으로 API에서 높은 오류율이 발생하고 있습니다. 공식 상태 페이지에서 진행 중인 사고를 확인했습니다.