AMD R9700에서 VS Code Copilot과 Qwen3.6-35B-A3B-UD-Q5_K_XL 로컬 실행

한 Reddit 사용자는 단일 AMD R9700 GPU에서 Vulkan을 사용하여 llama.cpp로 Qwen3.6-35B-A3B-UD-Q5_K_XL GGUF 모델을 로컬에서 실행하여 뛰어난 결과를 얻었다고 보고했습니다. 이 설정은 VS Code에서 GitHub Copilot의 대체재 역할을 했으며, 최소한의 개입으로 완전한 테스트 웹사이트와 Playwright 테스트 스위트를 생성했습니다.
llama.cpp 시작 명령어
/app/llama-server -m /models/Qwen3.6-35B-A3B-UD-Q5_K_XL/Qwen3.6-35B-A3B-UD-Q5_K_XL.gguf \
--ctx-size 262144 --threads 8 --threads-batch 8 \
--gpu-layers 99 --parallel 1 --flash-attn on \
--batch-size 2048 --ubatch-size 1024 \
--cache-type-k q8_0 --cache-type-v q8_0 \
--cache-ram 12000 --ctx-checkpoints 50 \
--mmap --no-mmproj --kv-unified \
--reasoning off --reasoning-budget 0 --jinja \
--temp 0.6 --top-k 20 --top-p 0.95 --min-p 0.0 \
--repeat-penalty 1.0 --presence-penalty 0.0
주요 매개변수: 256K 컨텍스트 창, 전체 오프로드를 위한 99개 GPU 레이어, 플래시 어텐션 활성화, 샘플링 구성은 Qwen3.6-35B-A3B Hugging Face 페이지의 "precise coding"에서 가져왔습니다.
VS Code 통합
사용자는 로컬 llama.cpp 서버를 가리키는 chatLanguageModels.json에 사용자 정의 채팅 모델을 구성했습니다:
{
"name": "Sean Llama.cpp",
"vendor": "customoai",
"apiKey": "${input:chat.lm.secret.3c0c0f21}",
"models": [
{
"id": "Qwen3.6-35B-A3B-UD-Q5_K_XL.gguf",
"name": "Qwen3.6-35B",
"url": "https://llm.home.arpa/v1/chat/completions",
"toolCalling": true,
"vision": false,
"maxInputTokens": 180000,
"maxOutputTokens": 10000,
"family": "Qwen3",
"inputTokenCost": 0.0001,
"outputTokenCost": 0.0001,
"temperature": 0.6,
"top_p": 0.95,
"top_k": 20,
"repeat_penalty": 1,
"presence_penalty": 0,
"frequency_penalty": 0,
"systemMessage": "You are a precise coding assistant. Avoid repeating plans. Execute tasks directly. Do not restate intentions multiple times.",
"timeout": 600000,
"retry": { "enabled": true, "max_attempts": 2, "interval_ms": 1500 }
}
]
}
모델은 도구 호출 요청에 올바르게 응답하여 Copilot 대체 역할을 수행할 수 있었습니다.
실제 테스트: 풀 스택 생성
사용자는 모델에게 (원래 ChatGPT에서 가져온) 상세한 프롬프트를 제공하여 "Bike Shop Service Tracker" — localStorage를 사용하는 로컬 우선 React + TypeScript 앱 —을 구축하도록 요청했습니다. 요구 사항에는 데이터 모델, 시드 데이터, 필터링, 정렬 및 양식 유효성 검사가 포함되었습니다. 모델은 첫 실행에서 완전히 작동하는 전체 웹사이트를 생성했습니다.
다음으로, 완전한 Playwright 테스트 스위트를 생성하도록 프롬프트했습니다. 하나의 테스트만 수동 수정이 필요했고, 나머지 스위트는 오류 없이 실행되었습니다. 사용자의 결론: "이제 (다음 큰 릴리스까지) 모델 조정과 테스트는 끝난 것 같고, 다시 코딩으로 돌아갈 수 있을 것 같습니다."
대상 사용자
코딩 지원을 위해 로컬 LLM을 실행하는 개발자, 특히 AMD GPU(Vulkan)를 사용하여 비슷한 품질의 Copilot 대안을 원하는 분들.
📖 전체 출처 읽기: r/LocalLLaMA
👀 See Also

브레인스톰 MCP 서버, 클로드가 더 나은 답변을 위해 다른 LLM들과 코드 상담을 할 수 있게 합니다
한 개발자가 Claude Code가 답변을 제공하기 전에 GPT-5.2 및 DeepSeek와 같은 다른 AI 모델과 상담할 수 있도록 하는 'brainstorm-mcp'라는 MCP 서버를 구축했습니다. 모델들은 서로의 응답을 읽고, 의견을 달리하며, 입장을 다듬어 더 나은 해결책에 수렴하는 다중 라운드 토론을 진행합니다.

인공 생명: 계산 생명 연구의 300줄 파이썬 재현
Computational Life 논문을 재현한 파이썬 구현체로, 240x135 그리드의 Brainfuck 유사 프로그램들이 무작위 쌍 구성과 명령어 테이프 연결을 통해 상호작용하며 자기복제 코드를 진화시킵니다.

클로드 보이스: 클로드 코드용 단어 강조 기능이 포함된 로컬 TTS
Claude-voice는 Claude Code의 음성 모드에 실시간 단어 하이라이트 기능이 포함된 로컬 텍스트 음성 변환을 추가하는 Python 도구입니다. 이 도구는 API 키 없이 완전히 로컬에서 실행되는 Kokoro TTS(8200만 매개변수)를 사용합니다.

오픈소스 MCP 제품군이 Claude 코드 생성 품질을 15-20% 향상시킵니다
오픈소스 MCP 스위트는 세 개의 로컬 서버와 프롬프트 스킬로 구성되어 있으며, AI 코드 생성의 '나쁜 토큰' 문제를 해결합니다. 한 고객은 Claude Code의 품질이 15-20% 향상되었다고 보고했습니다.