로컬 Claude 코드 설정: Qwen3.5 27B를 llama.cpp로 실행하기

로컬 Claude Code 구성
한 개발자가 llama.cpp를 사용한 로컬 LLM으로 Claude Code를 완전히 오프라인에서 실행하기 위한 설정을 문서화했습니다. 이 시스템은 Arch Linux와 Strix Halo 하드웨어에서 unsloth/UD-Q4_K_XL로 양자화된 Qwen3.5 27B를 사용합니다.
환경 구성
원격 측정을 비활성화하고 Claude Code를 완전히 오프라인으로 만들기 위해 ~/.bashrc에 다음 환경 변수를 설정했습니다:
export ANTHROPIC_BASE_URL="http://127.0.0.1:8001" export ANTHROPIC_API_KEY="not-set" export ANTHROPIC_AUTH_TOKEN="not-set" export CLAUDE_CODE_DISABLE_NONESSENTIAL_TRAFFIC=1 export CLAUDE_CODE_ENABLE_TELEMETRY=0 export DISABLE_AUTOUPDATER=1 export DISABLE_TELEMETRY=1 export CLAUDE_CODE_DISABLE_1M_CONTEXT=1 export CLAUDE_CODE_MAX_OUTPUT_TOKENS=4096 export CLAUDE_CODE_AUTO_COMPACT_WINDOW=32768
개발자는 환경 변수보다 claude/settings.json을 사용하는 것이 더 안정적이고 제어 가능하다고 언급했습니다.
llama.cpp 서버 구성
llama.cpp 서버는 다음 매개변수로 시작되었습니다:
ROCBLAS_USE_HIPBLASLT=1 ./build/bin/llama-server \ --model models/Qwen3.5-27B-Q4_K_M.gguf \ --alias "qwen3.5-27b" \ --port 8001 --ctx-size 65536 --n-gpu-layers 999 \ --flash-attn on --jinja --threads 8 \ --temp 0.6 --top-p 0.95 --top-k 20 --min-p 0.00 \ --cache-type-k q8_0 --cache-type-v q8_0
ROCBLAS_USE_HIPBLASLT=1 플래그는 Strix Halo 하드웨어에 필요했으며, 개발자는 llama.cpp 설정을 특화시키기 위해 특정 하드웨어를 연구하는 것이 중요하다고 강조했습니다.
성능 벤치마크
다음 결과와 함께 7번의 실행이 수행되었습니다:
- 실행 1 (파일 작업): 1분 44초, 초당 9.71 토큰, 23K 컨텍스트, 올바른 출력
- 실행 2 (Git 클론 + 코드 읽기): 2분 31초, 초당 9.56 토큰, 32.5K 컨텍스트, 우수한 품질
- 실행 3 (7일 계획 + 가이드): 4분 57초, 초당 8.37 토큰, 37.9K 컨텍스트, 우수한 품질
- 실행 4 (기술 평가): 4분 36초, 초당 8.46 토큰, 40K 컨텍스트, 매우 좋은 품질 (웹 검색 오작동)
- 실행 5 (Python 스크립트 작성): 10분 25초, 초당 7.54 토큰, 60.4K 컨텍스트, 좋은 품질 (7/10)
- 실행 6 (코드 검토 + 수정): 9분 29초, 초당 7.42 토큰, 65,535 컨텍스트 (충돌), 매우 좋은 품질 (8.5/10)
- 실행 7 (/compact 명령): 약 10분, 약 초당 8.07 토큰, 66,680 컨텍스트 (실패), 품질 N/A
주요 발견 사항
- 생성 속도는 컨텍스트 범위에서 약 24% 저하됨: 23K 컨텍스트에서 초당 9.71 토큰에서 65K 컨텍스트에서 초당 7.42 토큰으로
- Claude Code 시스템 프롬프트는 22,870 토큰을 소비함 (65K 예산의 35%)
- 자동 압축이 완전히 오작동: Claude Code는 200K 컨텍스트를 가정했으므로 95% 임계값은 190K였지만, 65K 제한은 Claude Code가 생각한 창의 33%에서 도달함
- /compact 명령은 출력 여유 공간이 필요함: 최대 4096 출력 토큰으로는 압축 요약이 맞지 않아 16K+ 토큰이 필요함
- 웹 검색 기능은 Anthropic 연결 없이 오작동함; 잠재적 해결책으로 SearXNG via MCP가 포함됨
📖 Read the full source: r/LocalLLaMA
👀 See Also

구독 모델을 활용한 비용 효율적인 OpenClaw 멀티 에이전트 설정
레딧 사용자가 원시 API 호출 대신 기존의 200달러 Anthropic Pro Max와 200달러 ChatGPT OpenAI Codex 구독을 통해 모든 OpenClaw 다중 에이전트 작업을 라우팅하는 방법을 설명하며, 간단한 에이전트에는 더 저렴한 Anthropic 모델을, 다른 작업에는 더 복잡한 모델을 사용합니다.

OpenClaw에서 별도의 작업 공간으로 서브 에이전트 설정하는 방법
여러 하위 에이전트를 격리된 작업 공간과 다양한 모델로 구성하는 커뮤니티 솔루션

플러그인 없이 OpenClaw 에이전트를 위한 4-파일 메모리 시스템
한 레딧 사용자가 네 개의 마크다운 파일을 활용한 실용적인 메모리 시스템을 공유합니다: USER.md는 정체성, CONTEXT.md는 현재 작업, MEMORY.md는 구조화된 주제, ARCHIVE.md는 완료된 항목을 담습니다. 이 접근법은 더 많은 메모리가 아닌 더 나은 파일 구조를 통해 '에이전트가 자신이 아는 것을 모른다'는 문제를 해결합니다.

효율적인 자동화를 위한 게이트웨이 연결 끊김 처리
게이트웨이 연결이 끊겼을 때 AI 코딩 에이전트 운영을 유지하는 실용적인 솔루션을 살펴보세요. Grafana를 통한 모니터링, 자동 재연결 스크립트, 신뢰성을 위한 중복 경로 활용 등 팁을 포함합니다.