Qwen 3.5 35B가 llama.cpp 구성으로 8GB VRAM에서 실행 중입니다

✍️ OpenClawRadar📅 게시일: March 27, 2026🔗 Source
Qwen 3.5 35B가 llama.cpp 구성으로 8GB VRAM에서 실행 중입니다
Ad

제한된 VRAM에서 로컬 Qwen 3.5 35B 설정

r/LocalLLaMA의 한 개발자가 8GB VRAM 하드웨어에서 Qwen 3.5 35B 모델을 로컬로 실행하기 위한 설정을 상세히 설명했습니다. 이들은 클라우드 서비스의 한계에 부딪힌 후 Google AI Pro 플랜과 함께 Antigravity를 사용하던 것에서 로컬 LLM으로 전환했습니다.

하드웨어 및 모델 사양

이 설정은 i9-14900HX CPU(BIOS에서 E-코어 비활성화, 32GB DDR5 RAM)와 8GB VRAM의 RTX 4060m GPU를 탑재한 Lenovo Legion 노트북을 사용합니다. 특정 모델은 Qwen 3.5 35B A3B Heretic Opus (Q4_K_M GGUF)입니다.

성능 및 llama.cpp 구성

개발자는 이 설정으로 프롬프트 처리에 약 초당 700 토큰, 토큰 생성에 초당 42 토큰의 속도를 얻었다고 보고합니다. 테스트 후 제공한 llama.cpp 명령줄 인수는 다음과 같습니다:

-ngl 99 ^
--n-cpu-moe 40 ^
-c 192000 ^
-t 12 ^
-tb 16 ^
-b 4096 ^
--ubatch-size 2048 ^
--flash-attn on ^
--cache-type-k q8_0 ^
--cache-type-v q8_0 ^
--mlock

워크플로우 통합

에이전트 워크플로우를 위해, 이들은 VSCode의 Cline이 Antigravity에 가장 가까운 대안임을 발견했습니다. 이 설정 내에서 Plan 모드에는 kat-coder-pro를, Act 모드에는 qwen3.5를 사용합니다. 개발자는 이 로컬 구성이 Antigravity의 Google Gemini 3 Flash를 고수하는 것보다 더 나은지 피드백을 구하며, 프라이버시 문제보다 원활한 워크플로우를 우선시한다고 언급합니다.

📖 Read the full source: r/LocalLLaMA

Ad

👀 See Also

Vibeyard를 사용한 AI 코딩 에이전트의 무음 도구 오류 감지
Tools

Vibeyard를 사용한 AI 코딩 에이전트의 무음 도구 오류 감지

Vibeyard는 AI 코딩 에이전트가 침묵하는 도구 실패를 감지하는 도구입니다. 이는 개발자에게 알리지 않고 대체 전략으로 전환하는 경우로, 세션 중에 이러한 비효율성을 표면화하고 반복되는 비효율적인 워크플로를 방지하기 위한 수정 사항을 제안할 수 있습니다.

OpenClawRadar
클라비스 MCP 서버: 클로드 데스크톱을 위한 안전한 자격 증명 관리
Tools

클라비스 MCP 서버: 클로드 데스크톱을 위한 안전한 자격 증명 관리

Clavis는 Claude Desktop의 API 키와 OAuth 토큰을 관리하는 MCP 서버로, AES-256 암호화로 자격 증명을 저장하고 중간 대화 만료 오류를 방지하기 위한 자동 토큰 갱신을 제공합니다.

OpenClawRadar
클로드 코드 핸드오프를 위한 자동화된 세션 상태 관리
Tools

클로드 코드 핸드오프를 위한 자동화된 세션 상태 관리

GitHub 프로젝트는 Claude 대화 전반에 걸쳐 실시간 세션 상태 파일(.claude/session-state.md)을 유지하는 자동화된 훅을 제공하여 자동 압축 컨텍스트 손실과 대화 중간 컨텍스트 저하 문제를 해결합니다. 이 시스템은 jq와 함께 4개의 bash 스크립트를 사용하여 중요한 이벤트와 파일 편집을 추적합니다.

OpenClawRadar
노렌 AI: 음성 추출 도구, 샘플에서 글쓰기 패턴 식별
Tools

노렌 AI: 음성 추출 도구, 샘플에서 글쓰기 패턴 식별

Noren AI는 5~10개의 글 샘플을 분석하여 실제 패턴을 기반으로 음성 가이드를 자동 생성하며, 수동으로 식별된 패턴의 90%를 일치시키고 추가 패턴을 발견합니다.

OpenClawRadar