RTX 3090에서 Qwen 3.6 27B/35B 최적화: 플래그, 양자화 및 자동 라우팅

RTX 3090(24GB VRAM), Ryzen 5700X, 64GB RAM, Windows 11에서 로컬로 Qwen 3.6 모델을 실행하는 개발자가 성능 및 신뢰성 문제를 겪고 있습니다. 사용자 정의 플래그로 llama-server를 사용하며 양자화 선택, 처리량, 자동 모델 라우팅에 대한 조언을 구하고 있습니다.
명령어 및 양자화
35B (UD Q4_K_M):
llama-server.exe -m "path\Qwen3.6-35B-A3B-UD-Q4_K_M.gguf" -ngl 99 -c 131072 -np 2 -fa on -ctk f16 -ctv f16 -b 2048 -ub 512 -t 8 --mlock -rea on --reasoning-budget 2048 --reasoning-format deepseek --jinja --metrics --slots --port 8081 --host 0.0.0.027B (UD Q4_K_XL):
llama-server.exe -m "path\Qwen3.6-27B-UD-Q4_K_XL.gguf" -ngl 99 -c 196608 -np 1 -fa on -ctk q8_0 -ctv q8_0 -b 2048 -ub 512 -t 8 --no-mmap -rea on --reasoning-budget -1 --reasoning-format deepseek --jinja --metrics --slots --port 8081 --host 0.0.0.0보고된 문제
- 35B 너무 느림 – 간단한 반복 작업조차 사용하기 어려움.
- 27B 빠르지만 불안정 – 코드 출력이 깨짐; 간단한 작업에 20-30분 소요.
- 수동 모델 전환 – 서버를 종료하고, 새 명령어를 붙여넣고, 모델을 다시 로드해야 함.
구체적인 질문
- 플래그가 최적이 아닌가요? (예: 컨텍스트 크기, 배치 크기, 캐시 유형)
- 24GB VRAM에서 속도와 코딩 정확도의 균형이 가장 좋은 양자화/모델은?
- 요청별로 자동으로 모델을 전환하거나 여러 모델을 warm 상태로 유지하고 라우팅하는 방법은?
컨텍스트
사용자는 Raspberry Pi 5에서 스크래핑 및 자동화를 위한 Hermes 에이전트를, OpenCode/QwenCode로 로컬 코딩을 실행합니다. 수동 서버 재시작이 필요 없는 설정을 원합니다.
📖 전체 출처 읽기: r/LocalLLaMA
👀 See Also

일탕일채: 인공지능 피로를 위한 일본 요리 원칙
Takuya는 일본 요리 원칙 '이치주잇사이( Ichiju Issai)'를 적용하여 AI 피로에 대처합니다 — 기술 스택을 하나의 주 도구와 하나의 부 도구로 단순화하세요, 마치 밥, 국, 한 가지 반찬으로 된 식사처럼.

150개 이상의 PR/주로 에이전트 코딩 확장: Lovable에서 토큰 85,000달러 사용으로 얻은 교훈
Alexander Lebedev가 2026년 1월부터 AI 토큰에 85,000달러를 사용하여 주당 20~30개의 PR에서 150개 이상의 PR로 확장한 방법을 공유합니다. 주요 학습 포인트: 위험 분류, AI 리뷰가 인간 코드 리뷰를 대체, 지식 확산 보존의 과제.

사후 분석: 오래된 OAuth와 격리된 크론 작업으로 인한 Claude Max + OpenClaw 청구 오류
OpenClaw 에이전트가 오래된 OAuth 토큰으로 인해 무작위로 중단되며, 이 토큰이 Anthropic 제공자 전체를 블랙리스트에 등록하고 격리된 cron 작업이 Extra Usage 버킷을 사용합니다. 완전한 수정: 수동 프로필 제거, cron을 메인 세션으로 이동, 결제 잠금 해제.

크론 작업 vs 하트비트: OpenClaw 토큰 사용 및 실행 일관성 최적화
시니어 개발자가 OpenClaw에서 Heartbeat 대신 Cron 작업을 사용하여 토큰 사용량을 줄이고 실행 일관성을 높이는 실용적인 팁을 구체적인 예제와 쉘 스크립트 방법과 함께 공유합니다.