RTX 3090에서 Qwen 3.6 27B/35B 최적화: 플래그, 양자화 및 자동 라우팅

✍️ OpenClawRadar📅 게시일: May 5, 2026🔗 Source
RTX 3090에서 Qwen 3.6 27B/35B 최적화: 플래그, 양자화 및 자동 라우팅
Ad

RTX 3090(24GB VRAM), Ryzen 5700X, 64GB RAM, Windows 11에서 로컬로 Qwen 3.6 모델을 실행하는 개발자가 성능 및 신뢰성 문제를 겪고 있습니다. 사용자 정의 플래그로 llama-server를 사용하며 양자화 선택, 처리량, 자동 모델 라우팅에 대한 조언을 구하고 있습니다.

명령어 및 양자화

35B (UD Q4_K_M):

llama-server.exe -m "path\Qwen3.6-35B-A3B-UD-Q4_K_M.gguf" -ngl 99 -c 131072 -np 2 -fa on -ctk f16 -ctv f16 -b 2048 -ub 512 -t 8 --mlock -rea on --reasoning-budget 2048 --reasoning-format deepseek --jinja --metrics --slots --port 8081 --host 0.0.0.0

27B (UD Q4_K_XL):

llama-server.exe -m "path\Qwen3.6-27B-UD-Q4_K_XL.gguf" -ngl 99 -c 196608 -np 1 -fa on -ctk q8_0 -ctv q8_0 -b 2048 -ub 512 -t 8 --no-mmap -rea on --reasoning-budget -1 --reasoning-format deepseek --jinja --metrics --slots --port 8081 --host 0.0.0.0
Ad

보고된 문제

  • 35B 너무 느림 – 간단한 반복 작업조차 사용하기 어려움.
  • 27B 빠르지만 불안정 – 코드 출력이 깨짐; 간단한 작업에 20-30분 소요.
  • 수동 모델 전환 – 서버를 종료하고, 새 명령어를 붙여넣고, 모델을 다시 로드해야 함.

구체적인 질문

  • 플래그가 최적이 아닌가요? (예: 컨텍스트 크기, 배치 크기, 캐시 유형)
  • 24GB VRAM에서 속도와 코딩 정확도의 균형이 가장 좋은 양자화/모델은?
  • 요청별로 자동으로 모델을 전환하거나 여러 모델을 warm 상태로 유지하고 라우팅하는 방법은?

컨텍스트

사용자는 Raspberry Pi 5에서 스크래핑 및 자동화를 위한 Hermes 에이전트를, OpenCode/QwenCode로 로컬 코딩을 실행합니다. 수동 서버 재시작이 필요 없는 설정을 원합니다.

📖 전체 출처 읽기: r/LocalLLaMA

Ad

👀 See Also

일탕일채: 인공지능 피로를 위한 일본 요리 원칙
Guides

일탕일채: 인공지능 피로를 위한 일본 요리 원칙

Takuya는 일본 요리 원칙 '이치주잇사이( Ichiju Issai)'를 적용하여 AI 피로에 대처합니다 — 기술 스택을 하나의 주 도구와 하나의 부 도구로 단순화하세요, 마치 밥, 국, 한 가지 반찬으로 된 식사처럼.

OpenClawRadar
150개 이상의 PR/주로 에이전트 코딩 확장: Lovable에서 토큰 85,000달러 사용으로 얻은 교훈
Guides

150개 이상의 PR/주로 에이전트 코딩 확장: Lovable에서 토큰 85,000달러 사용으로 얻은 교훈

Alexander Lebedev가 2026년 1월부터 AI 토큰에 85,000달러를 사용하여 주당 20~30개의 PR에서 150개 이상의 PR로 확장한 방법을 공유합니다. 주요 학습 포인트: 위험 분류, AI 리뷰가 인간 코드 리뷰를 대체, 지식 확산 보존의 과제.

OpenClawRadar
사후 분석: 오래된 OAuth와 격리된 크론 작업으로 인한 Claude Max + OpenClaw 청구 오류
Guides

사후 분석: 오래된 OAuth와 격리된 크론 작업으로 인한 Claude Max + OpenClaw 청구 오류

OpenClaw 에이전트가 오래된 OAuth 토큰으로 인해 무작위로 중단되며, 이 토큰이 Anthropic 제공자 전체를 블랙리스트에 등록하고 격리된 cron 작업이 Extra Usage 버킷을 사용합니다. 완전한 수정: 수동 프로필 제거, cron을 메인 세션으로 이동, 결제 잠금 해제.

OpenClawRadar
크론 작업 vs 하트비트: OpenClaw 토큰 사용 및 실행 일관성 최적화
Guides

크론 작업 vs 하트비트: OpenClaw 토큰 사용 및 실행 일관성 최적화

시니어 개발자가 OpenClaw에서 Heartbeat 대신 Cron 작업을 사용하여 토큰 사용량을 줄이고 실행 일관성을 높이는 실용적인 팁을 구체적인 예제와 쉘 스크립트 방법과 함께 공유합니다.

OpenClawRadar