Qwen3.6 27B FP8, RTX 5000 PRO 48GB에서 BF16 KV 캐시 20만 토큰을 80 TPS로 실행

r/LocalLLaMA의 Reddit 사용자가 단일 RTX 5000 PRO 48GB GPU에서 Qwen3.6-27B-FP8을 BF16 KV 캐시(200k 토큰)로 실행하여 60–90 TPS를 달성했다고 보고했습니다. 이 설정은 vLLM 0.20.1, CUDA 12.9, Qwen의 공식 FP8 양자화를 사용하며, 멀티모달 및 MTP 추측 디코딩을 지원합니다.
설정 세부 사항
환경은 FlashInfer FP8 MoE, FP8 Marlin 및 비동기 스케줄링을 사용합니다. 주요 환경 변수 및 실행 명령:
export VLLM_USE_FLASHINFER_MOE_FP8=1
export VLLM_TEST_FORCE_FP8_MARLIN=1
export VLLM_SLEEP_WHEN_IDLE=1
export VLLM_MEMORY_PROFILER_ESTIMATE_CUDAGRAPHS=1
export VLLM_LOG_STATS_INTERVAL=2
export VLLM_WORKER_MULTIPROC_METHOD=spawn
export SAFETENSORS_FAST_GPU=1
export CUDA_DEVICE_ORDER=PCI_BUS_ID
export TORCH_FLOAT32_MATMUL_PRECISION=high
export PYTORCH_ALLOC_CONF=expandable_segments:True
vllm serve Qwen/Qwen3.6-27B-FP8
--host 0.0.0.0 --port 8080
--performance-mode interactivity
--trust-remote-code
--enable-auto-tool-choice
--tool-call-parser qwen3_coder
--reasoning-parser qwen3
--mm-encoder-tp-mode data
--mm-processor-cache-type shm
--gpu-memory-utilization 0.975
--speculative-config '{"method":"mtp","num_speculative_tokens":2}'
--compilation-config '{"cudagraph_mode": "FULL_AND_PIECEWISE", "max_cudagraph_capture_size": 16, "mode": "VLLM_COMPILE"}'
--async-scheduling
--attention-backend flashinfer
--max-model-len 196608
--kv-cache-dtype bfloat16
--enable-prefix-caching
성능 관찰
MTP=2 추측 디코딩을 통해 코드 생성 시 60–90 TPS를 생성합니다. BF16 KV 캐시는 양자화된 KV에서 발생하는 압축 문제를 피하여 긴 코딩 세션을 더 안정적으로 만듭니다. 사용자는 이 설정이 64GB 시스템 RAM과 적절한 CPU를 갖춘 단일 RTX 5000 PRO 48GB에서 실행되며, 로컬 LLM 개발을 위한 $10,000 워크스테이션의 강력한 후보라고 언급합니다.
대상 사용자
최소한의 양자화 아티팩트와 긴 컨텍스트 윈도우로 로컬에서 에이전트 기반 코딩 설정이 필요한 개발자.
📖 원문 보기: r/LocalLLaMA
👀 See Also

OpenClaw 5.4, /steer 및 /side 명령 추가: 컨텍스트 손실 없이 작업 중 에이전트 리디렉션
OpenClaw 5.4에는 /steer와 /side 명령이 도입되어, 에이전트의 현재 작업 방향을 변경하거나 세션 컨텍스트를 유지한 채로 사이드 대화를 시작할 수 있습니다.

서브쿼드라틱, AI 모델용 1200만 토큰 컨텍스트 윈도우 공개
Subquadratic가 1,200만 토큰 컨텍스트 윈도우를 출시하여 LLM 추론의 이전 한계를 깨뜨리고 단일 패스로 전체 코드베이스를 처리할 수 있게 했습니다.

FPGA 기반 뉴로모픽 이징 머신, 어려운 조합 최적화 문제 해결
FPGA에 구현된 뉴로모픽 이싱 머신이 양자 터널링 물리학과 뇌에서 영감을 받은 아키텍처를 사용하여 단백질 폴딩과 같은 조합 최적화 문제를 해결합니다.

VibeThinker-3B: AIME 수학 벤치마크에서 671B DeepSeek와 성능이 일치하는 3B 파라미터 모델
중국 시나 웨이보 연구진이 공개한 VibeThinker-3B는 3B 매개변수 모델로 AIME 2026에서 94.3점을 기록, DeepSeek V3.2(671B)와 동등한 성능을 보였다. 논문은 '매개변수 압축-커버리지 가설'을 제시하며 검증 가능한 추론이 소형 모델로 압축될 수 있다고 주장한다.