RTX 3090에서 Qwen 3.6 27B/35B 최적화: 플래그, 양자화 및 자동 라우팅

✍️ OpenClawRadar📅 게시일: May 5, 2026🔗 Source
RTX 3090에서 Qwen 3.6 27B/35B 최적화: 플래그, 양자화 및 자동 라우팅
Ad

RTX 3090(24GB VRAM), Ryzen 5700X, 64GB RAM, Windows 11에서 로컬로 Qwen 3.6 모델을 실행하는 개발자가 성능 및 신뢰성 문제를 겪고 있습니다. 사용자 정의 플래그로 llama-server를 사용하며 양자화 선택, 처리량, 자동 모델 라우팅에 대한 조언을 구하고 있습니다.

명령어 및 양자화

35B (UD Q4_K_M):

llama-server.exe -m "path\Qwen3.6-35B-A3B-UD-Q4_K_M.gguf" -ngl 99 -c 131072 -np 2 -fa on -ctk f16 -ctv f16 -b 2048 -ub 512 -t 8 --mlock -rea on --reasoning-budget 2048 --reasoning-format deepseek --jinja --metrics --slots --port 8081 --host 0.0.0.0

27B (UD Q4_K_XL):

llama-server.exe -m "path\Qwen3.6-27B-UD-Q4_K_XL.gguf" -ngl 99 -c 196608 -np 1 -fa on -ctk q8_0 -ctv q8_0 -b 2048 -ub 512 -t 8 --no-mmap -rea on --reasoning-budget -1 --reasoning-format deepseek --jinja --metrics --slots --port 8081 --host 0.0.0.0
Ad

보고된 문제

  • 35B 너무 느림 – 간단한 반복 작업조차 사용하기 어려움.
  • 27B 빠르지만 불안정 – 코드 출력이 깨짐; 간단한 작업에 20-30분 소요.
  • 수동 모델 전환 – 서버를 종료하고, 새 명령어를 붙여넣고, 모델을 다시 로드해야 함.

구체적인 질문

  • 플래그가 최적이 아닌가요? (예: 컨텍스트 크기, 배치 크기, 캐시 유형)
  • 24GB VRAM에서 속도와 코딩 정확도의 균형이 가장 좋은 양자화/모델은?
  • 요청별로 자동으로 모델을 전환하거나 여러 모델을 warm 상태로 유지하고 라우팅하는 방법은?

컨텍스트

사용자는 Raspberry Pi 5에서 스크래핑 및 자동화를 위한 Hermes 에이전트를, OpenCode/QwenCode로 로컬 코딩을 실행합니다. 수동 서버 재시작이 필요 없는 설정을 원합니다.

📖 전체 출처 읽기: r/LocalLLaMA

Ad

👀 See Also

Anthropic, Claude AI 무료 공식 학습 플랫폼 출시
Guides

Anthropic, Claude AI 무료 공식 학습 플랫폼 출시

Anthropic은 Claude 기초, API 통합, 에이전트 기술 및 다양한 사용자 그룹을 위한 전문 트랙을 다루는 구조화된 과정을 포함한 무료 학습 플랫폼을 출시했습니다.

OpenClawRadar
Opus 4.7, 프롬프트의 40%를 망가뜨렸다; 해결책은 CLAUDE.md와 스킬의 구조화였다
Guides

Opus 4.7, 프롬프트의 40%를 망가뜨렸다; 해결책은 CLAUDE.md와 스킬의 구조화였다

Opus 4.7이 출시된 후 6개 설정에서 약 40%의 프롬프트 성능이 저하되자, AI 책임자가 임시 프롬프트를 구조화된 Skill 파일, 계층적 CLAUDE.md, 그리고 별도의 메모리 파일로 대체하여 토큰 사용량을 22% 줄이고 반복 횟수를 3-4회에서 1-2회로 줄였습니다.

OpenClawRadar
OpenCLAW 메모리가 실제로 작동하는 방식: 에이전트 '망각' 문제 해결하기
Guides

OpenCLAW 메모리가 실제로 작동하는 방식: 에이전트 '망각' 문제 해결하기

OpenCLAW 에이전트는 대화 간 지속적인 메모리를 갖지 않습니다 - 각 세션마다 SOUL.md, USER.md, MEMORY.md와 같은 파일에서 컨텍스트를 재구성합니다. 흔한 '잊어버림' 문제는 세션 비대화, 구조화되지 않은 메모리 파일, 채팅 기록과 영구 저장소를 혼동하는 데서 비롯됩니다.

OpenClawRadar
클루드코드를 웹앱에 연결하여 자동화된 상호작용 구현하기
Guides

클루드코드를 웹앱에 연결하여 자동화된 상호작용 구현하기

CludeCode가 브라우저 및 스크래핑 유틸리티와 같은 AI 도구를 활용하여 웹 애플리케이션과 자동으로 상호작용하는 방법을 살펴보세요.

OpenClawRadar