로컬에서 Qwen3.5-27B 설정하기: vLLM vs llama.cpp 비교

✍️ OpenClawRadar📅 게시일: March 15, 2026🔗 Source
로컬에서 Qwen3.5-27B 설정하기: vLLM vs llama.cpp 비교
Ad

Qwen3.5-27B 성능 및 기능

Qwen3.5-27B 모델은 소스에 따르면 다양한 벤치마크에서 강력한 성능을 보입니다: MMLU-Pro: 85.3, MMLU-Redux: 93.3, C-Eval: 90.2, 종합 지능 점수: 42.1 (비교 모델 중 91%보다 우수), 코딩 지수: 34.9 (코딩 능력 상위 88%). 이 모델은 기본 262k 컨텍스트를 지원하며 1M+ 토큰까지 확장 가능한 조밀한 아키텍처를 특징으로 합니다.

백엔드 비교: llama.cpp 대 vLLM

소스는 로컬 배포를 위한 두 가지 주요 접근 방식을 비교합니다:

옵션 1: llama.cpp

  • 장점: 낮은 리소스 사용량, 쉬운 설정, 합리적인 VRAM 사용을 위한 q4 KV 캐시 지원
  • 단점: KV 캐시가 무작위로 초기화되는 주요 문제로 인해 세션 중간에 전체 프롬프트 재처리가 강제됩니다. MTP를 통한 추측 디코딩이 작동하지 않습니다. 아직 확실한 수정이 없는 알려진 버그입니다.

옵션 2: vLLM

  • 장점: 안정적인 세션, KV 초기화 없음, 더 빠른 생성을 위한 MTP 추측 디코딩 지원
  • 단점: q4 KV 지원이 없어 256k 컨텍스트에서 VRAM 급증이 발생합니다. v0.17.1에서 Qwen3.5의 도구 호출 파싱이 버그가 있으며, 오픈 GitHub PR에 수정 사항이 있지만 아직 병합되지 않았습니다. 이로 인해 잘못된 JSON 출력으로 에이전트 코딩 흐름이 중단됩니다.
Ad

권장 vLLM 구성

소스는 HF의 모델 osoleve/Qwen3.5-27B-Text-NVFP4-MTP를 사용한 안정적이고 고속 실행을 위한 특정 구성 권장사항을 제공합니다:

  • 최적화된 성능을 위해 flashinfer cutlass 백엔드 사용
  • 컨텍스트 창을 128k로 설정 (VRAM과 사용성 균형; 하드웨어가 허용하면 256k로 증가)
  • OOM 충돌을 피하기 위해 GPU 사용률을 0.82로 제한
  • max-num-seq를 2로 설정 (과도한 리소스 할당 없이 단일 세션 처리 가능)
  • 속도 향상을 위해 MTP 추측 디코딩 활성화
  • 오픈 PR의 Qwen 도구 호출 파싱 수정 사항으로 vLLM 패치 적용
  • Claude 코드 cli 사용 - 오픈 코드는 패치 후에도 도구 호출 파싱 문제가 나타나지 않음

성능 결과

소스에 따르면 성능은 하드웨어에 따라 다릅니다:

  • RTX 5090 (32GB VRAM): ~50 TPS
  • RTX Pro 6000 (96GB VRAM): 전체 256k 컨텍스트에서 70 TPS

📖 Read the full source: r/LocalLLaMA

Ad

👀 See Also

OpenRouter에서 무료 OpenClaw 사용을 위해 Qwen 3.6 Plus Preview를 설정하는 방법
Guides

OpenRouter에서 무료 OpenClaw 사용을 위해 Qwen 3.6 Plus Preview를 설정하는 방법

Qwen 3.6 Plus Preview는 현재 OpenRouter에서 100만 토큰 컨텍스트 윈도우를 제공하며 무료로 이용 가능하여 AI 에이전트 작업에 적합합니다. 설정 과정은 OpenRouter 계정 생성, OpenClaw에 제공자 추가, 모델 구성으로 이루어집니다.

OpenClawRadar
두 개의 $0 OpenClaw 설정, 무료 클라우드 모델 또는 로컬 Ollama 사용
Guides

두 개의 $0 OpenClaw 설정, 무료 클라우드 모델 또는 로컬 Ollama 사용

레딧 게시물에서는 OpenClaw 에이전트를 무료로 실행하는 두 가지 방법을 설명합니다: OpenRouter, Gemini, Groq의 무료 티어를 이용해 속도 제한을 받는 방법, 또는 Ollama를 통해 로컬 모델을 실행하여 API 키 없이 데이터가 사용자의 기기를 떠나지 않게 하는 방법입니다.

OpenClawRadar
OpenClaw 설정: Docker, Chromium, noVNC를 활용한 인간 참여형 브라우저 자동화
Guides

OpenClaw 설정: Docker, Chromium, noVNC를 활용한 인간 참여형 브라우저 자동화

한 개발자가 OpenClaw가 CAPTCHA와 승인을 런타임 중에 처리할 수 있도록 Docker 컨테이너 설정을 공유했습니다. 이 설정은 Chromium과 noVNC를 사용하여 원격 접근을 가능하게 하며, 약 300MB의 RAM과 3초의 콜드 스타트 시간이 필요합니다.

OpenClawRadar
실용적인 OpenClaw 조언: 작게 시작하고 흔한 함정 피하기
Guides

실용적인 OpenClaw 조언: 작게 시작하고 흔한 함정 피하기

한 개발자가 OpenClaw로 개인 건강 추적기를 만든 경험에서 얻은 교훈을 공유하며, 좁은 범위, 결정론적 워크플로우, 하나의 LLM 고수 등을 강조했습니다. 이 글은 ChatGPT와 Gemini를 비교한 구체적인 모델 관찰도 포함하고 있습니다.

OpenClawRadar