로컬에서 Qwen3.5-27B 설정하기: vLLM vs llama.cpp 비교

✍️ OpenClawRadar📅 게시일: March 15, 2026🔗 Source
로컬에서 Qwen3.5-27B 설정하기: vLLM vs llama.cpp 비교
Ad

Qwen3.5-27B 성능 및 기능

Qwen3.5-27B 모델은 소스에 따르면 다양한 벤치마크에서 강력한 성능을 보입니다: MMLU-Pro: 85.3, MMLU-Redux: 93.3, C-Eval: 90.2, 종합 지능 점수: 42.1 (비교 모델 중 91%보다 우수), 코딩 지수: 34.9 (코딩 능력 상위 88%). 이 모델은 기본 262k 컨텍스트를 지원하며 1M+ 토큰까지 확장 가능한 조밀한 아키텍처를 특징으로 합니다.

백엔드 비교: llama.cpp 대 vLLM

소스는 로컬 배포를 위한 두 가지 주요 접근 방식을 비교합니다:

옵션 1: llama.cpp

  • 장점: 낮은 리소스 사용량, 쉬운 설정, 합리적인 VRAM 사용을 위한 q4 KV 캐시 지원
  • 단점: KV 캐시가 무작위로 초기화되는 주요 문제로 인해 세션 중간에 전체 프롬프트 재처리가 강제됩니다. MTP를 통한 추측 디코딩이 작동하지 않습니다. 아직 확실한 수정이 없는 알려진 버그입니다.

옵션 2: vLLM

  • 장점: 안정적인 세션, KV 초기화 없음, 더 빠른 생성을 위한 MTP 추측 디코딩 지원
  • 단점: q4 KV 지원이 없어 256k 컨텍스트에서 VRAM 급증이 발생합니다. v0.17.1에서 Qwen3.5의 도구 호출 파싱이 버그가 있으며, 오픈 GitHub PR에 수정 사항이 있지만 아직 병합되지 않았습니다. 이로 인해 잘못된 JSON 출력으로 에이전트 코딩 흐름이 중단됩니다.
Ad

권장 vLLM 구성

소스는 HF의 모델 osoleve/Qwen3.5-27B-Text-NVFP4-MTP를 사용한 안정적이고 고속 실행을 위한 특정 구성 권장사항을 제공합니다:

  • 최적화된 성능을 위해 flashinfer cutlass 백엔드 사용
  • 컨텍스트 창을 128k로 설정 (VRAM과 사용성 균형; 하드웨어가 허용하면 256k로 증가)
  • OOM 충돌을 피하기 위해 GPU 사용률을 0.82로 제한
  • max-num-seq를 2로 설정 (과도한 리소스 할당 없이 단일 세션 처리 가능)
  • 속도 향상을 위해 MTP 추측 디코딩 활성화
  • 오픈 PR의 Qwen 도구 호출 파싱 수정 사항으로 vLLM 패치 적용
  • Claude 코드 cli 사용 - 오픈 코드는 패치 후에도 도구 호출 파싱 문제가 나타나지 않음

성능 결과

소스에 따르면 성능은 하드웨어에 따라 다릅니다:

  • RTX 5090 (32GB VRAM): ~50 TPS
  • RTX Pro 6000 (96GB VRAM): 전체 256k 컨텍스트에서 70 TPS

📖 Read the full source: r/LocalLLaMA

Ad

👀 See Also

개인 AI 에이전트 구축을 위한 100가지 팁: 클라우드 프로토타입에서 프로덕션까지
Guides

개인 AI 에이전트 구축을 위한 100가지 팁: 클라우드 프로토타입에서 프로덕션까지

지속형 AI 에이전트(챗봇 래퍼가 아님)를 6주 동안 구축하면서 얻은 핵심 교훈: 작업 관리, 거래 추적, 이메일 읽기, 데이터 분석. 시스템 프롬프트 대신 헌법을 작성하고, 메모리에 플랫 마크다운 파일을 사용하며, ID 파일을 git에서 버전 관리하라.

OpenClawRadar
클로드로 API 엔드포인트 구축하기: 70개 이상의 엔드포인트 프로젝트에서 얻은 실용적인 프롬프트 엔지니어링 교훈
Guides

클로드로 API 엔드포인트 구축하기: 70개 이상의 엔드포인트 프로젝트에서 얻은 실용적인 프롬프트 엔지니어링 교훈

한 개발자가 Claude를 사용하여 코드의 약 80%를 작성하며 70개 이상의 LinkedIn 자동화 API 엔드포인트를 구축했습니다. 이 프로젝트는 행동 수행 에이전트(API 호출, 데이터 추출, 의사결정 트리 등을 실행하는 에이전트)를 위한 프롬프트 구성에 대한 구체적인 교훈을 보여주었는데, 자연어 지시보다는 명시적 제약 조건을 가진 계약서처럼 프롬프트를 다루는 것이 더 효과적임을 발견했습니다.

OpenClawRadar
OpenClaw 고장 패턴: 28일 동안 발생한 42건의 실제 사례
Guides

OpenClaw 고장 패턴: 28일 동안 발생한 42건의 실제 사례

OpenClaw를 매일 실행하는 개발자가 AI 환각, 인증 고장, 시간을 더 소모하는 자동화 등 8개 범주에 걸친 42가지 구체적인 실패 사례를 기록했습니다. 출처는 Google OAuth 7일 토큰 만료, Opus 4.6이 파일에 원치 않는 메타데이터를 추가하는 사례 등 구체적인 예시를 제공합니다.

OpenClawRadar
OpenClaw 에이전트 자율성 문제 해결: 스킬 파일, 도구 선택 및 Cron 설정
Guides

OpenClaw 에이전트 자율성 문제 해결: 스킬 파일, 도구 선택 및 Cron 설정

개발자가 OpenClaw 에이전트가 초기 설정 후 자동으로 작동을 멈추는 문제에 대한 해결책을 공유합니다. 주요 수정 방법으로는 채팅 지시 대신 외부 스킬 파일 사용, 브라우저 도구를 API 기반 도구나 Puppeteer 스크립트로 대체, cron 작업 올바르게 구성하기 등이 있습니다.

OpenClawRadar