Qwen 3.5 35B가 llama.cpp 구성으로 8GB VRAM에서 실행 중입니다

제한된 VRAM에서 로컬 Qwen 3.5 35B 설정
r/LocalLLaMA의 한 개발자가 8GB VRAM 하드웨어에서 Qwen 3.5 35B 모델을 로컬로 실행하기 위한 설정을 상세히 설명했습니다. 이들은 클라우드 서비스의 한계에 부딪힌 후 Google AI Pro 플랜과 함께 Antigravity를 사용하던 것에서 로컬 LLM으로 전환했습니다.
하드웨어 및 모델 사양
이 설정은 i9-14900HX CPU(BIOS에서 E-코어 비활성화, 32GB DDR5 RAM)와 8GB VRAM의 RTX 4060m GPU를 탑재한 Lenovo Legion 노트북을 사용합니다. 특정 모델은 Qwen 3.5 35B A3B Heretic Opus (Q4_K_M GGUF)입니다.
성능 및 llama.cpp 구성
개발자는 이 설정으로 프롬프트 처리에 약 초당 700 토큰, 토큰 생성에 초당 42 토큰의 속도를 얻었다고 보고합니다. 테스트 후 제공한 llama.cpp 명령줄 인수는 다음과 같습니다:
-ngl 99 ^ --n-cpu-moe 40 ^ -c 192000 ^ -t 12 ^ -tb 16 ^ -b 4096 ^ --ubatch-size 2048 ^ --flash-attn on ^ --cache-type-k q8_0 ^ --cache-type-v q8_0 ^ --mlock
워크플로우 통합
에이전트 워크플로우를 위해, 이들은 VSCode의 Cline이 Antigravity에 가장 가까운 대안임을 발견했습니다. 이 설정 내에서 Plan 모드에는 kat-coder-pro를, Act 모드에는 qwen3.5를 사용합니다. 개발자는 이 로컬 구성이 Antigravity의 Google Gemini 3 Flash를 고수하는 것보다 더 나은지 피드백을 구하며, 프라이버시 문제보다 원활한 워크플로우를 우선시한다고 언급합니다.
📖 Read the full source: r/LocalLLaMA
👀 See Also

고도젠: 완전한 고도트 게임 생성을 위한 클로드 코드 스킬
Godogen은 텍스트 프롬프트를 사용하여 완전히 플레이 가능한 Godot 4 프로젝트를 생성하는 오픈소스 파이프라인입니다. Claude Code 기술을 활용하여 아키텍처 설계, 2D/3D 에셋 생성, GDScript 작성, 시각적 QA 테스트를 처리하며, GDScript 학습 데이터 부족 및 빌드 타임 대 런타임 상태 문제와 같은 특정 엔지니어링 병목 현상을 해결합니다.

수행사: 에이전트 내레이션을 침묵시켜 맥락과 토큰을 절약하는 기술
레딧 사용자가 클로드 에이전트 응답에서 서사, 서문, 후문을 제거하는 스킬 'monk'를 게시했으며, 턴당 출력 토큰이 약 54% 감소하고 100회에서 컨텍스트 용량이 29-39% 증가한다고 주장합니다.

Anchormd: 클로드 AI 세션 간 컨텍스트 관리 도구
Anchormd는 선별된 마크다운 계획을 검색 가능한 지식 그래프로 인덱싱하여 Claude AI 세션 간 컨텍스트 손실 문제를 해결하는 오픈소스 도구입니다. 에이전트가 세션 시작 시 프로젝트 개요를 로드하고 필요에 따라 특정 세부 사항을 쿼리할 수 있도록 합니다.

onWatch: SQLite 저장소를 사용한 오픈소스 로컬 API 할당량 추적기
onWatch는 모든 데이터를 로컬 SQLite 데이터베이스에 저장하며 클라우드 서비스, 원격 측정 또는 계정 생성이 필요 없는 로컬 퍼스트 API 할당량 추적기입니다. ~13MB 크기의 단일 바이너리로, 백그라운드 데몬으로 실행되며 <50MB의 RAM을 사용하고 localhost에 대시보드를 제공합니다.