AMD R9700에서 VS Code Copilot과 Qwen3.6-35B-A3B-UD-Q5_K_XL 로컬 실행

✍️ OpenClawRadar📅 게시일: May 7, 2026🔗 Source
AMD R9700에서 VS Code Copilot과 Qwen3.6-35B-A3B-UD-Q5_K_XL 로컬 실행
Ad

한 Reddit 사용자는 단일 AMD R9700 GPU에서 Vulkan을 사용하여 llama.cppQwen3.6-35B-A3B-UD-Q5_K_XL GGUF 모델을 로컬에서 실행하여 뛰어난 결과를 얻었다고 보고했습니다. 이 설정은 VS Code에서 GitHub Copilot의 대체재 역할을 했으며, 최소한의 개입으로 완전한 테스트 웹사이트와 Playwright 테스트 스위트를 생성했습니다.

llama.cpp 시작 명령어

/app/llama-server -m /models/Qwen3.6-35B-A3B-UD-Q5_K_XL/Qwen3.6-35B-A3B-UD-Q5_K_XL.gguf \
  --ctx-size 262144 --threads 8 --threads-batch 8 \
  --gpu-layers 99 --parallel 1 --flash-attn on \
  --batch-size 2048 --ubatch-size 1024 \
  --cache-type-k q8_0 --cache-type-v q8_0 \
  --cache-ram 12000 --ctx-checkpoints 50 \
  --mmap --no-mmproj --kv-unified \
  --reasoning off --reasoning-budget 0 --jinja \
  --temp 0.6 --top-k 20 --top-p 0.95 --min-p 0.0 \
  --repeat-penalty 1.0 --presence-penalty 0.0

주요 매개변수: 256K 컨텍스트 창, 전체 오프로드를 위한 99개 GPU 레이어, 플래시 어텐션 활성화, 샘플링 구성은 Qwen3.6-35B-A3B Hugging Face 페이지의 "precise coding"에서 가져왔습니다.

Ad

VS Code 통합

사용자는 로컬 llama.cpp 서버를 가리키는 chatLanguageModels.json에 사용자 정의 채팅 모델을 구성했습니다:

{
  "name": "Sean Llama.cpp",
  "vendor": "customoai",
  "apiKey": "${input:chat.lm.secret.3c0c0f21}",
  "models": [
    {
      "id": "Qwen3.6-35B-A3B-UD-Q5_K_XL.gguf",
      "name": "Qwen3.6-35B",
      "url": "https://llm.home.arpa/v1/chat/completions",
      "toolCalling": true,
      "vision": false,
      "maxInputTokens": 180000,
      "maxOutputTokens": 10000,
      "family": "Qwen3",
      "inputTokenCost": 0.0001,
      "outputTokenCost": 0.0001,
      "temperature": 0.6,
      "top_p": 0.95,
      "top_k": 20,
      "repeat_penalty": 1,
      "presence_penalty": 0,
      "frequency_penalty": 0,
      "systemMessage": "You are a precise coding assistant. Avoid repeating plans. Execute tasks directly. Do not restate intentions multiple times.",
      "timeout": 600000,
      "retry": { "enabled": true, "max_attempts": 2, "interval_ms": 1500 }
    }
  ]
}

모델은 도구 호출 요청에 올바르게 응답하여 Copilot 대체 역할을 수행할 수 있었습니다.

실제 테스트: 풀 스택 생성

사용자는 모델에게 (원래 ChatGPT에서 가져온) 상세한 프롬프트를 제공하여 "Bike Shop Service Tracker" — localStorage를 사용하는 로컬 우선 React + TypeScript 앱 —을 구축하도록 요청했습니다. 요구 사항에는 데이터 모델, 시드 데이터, 필터링, 정렬 및 양식 유효성 검사가 포함되었습니다. 모델은 첫 실행에서 완전히 작동하는 전체 웹사이트를 생성했습니다.

다음으로, 완전한 Playwright 테스트 스위트를 생성하도록 프롬프트했습니다. 하나의 테스트만 수동 수정이 필요했고, 나머지 스위트는 오류 없이 실행되었습니다. 사용자의 결론: "이제 (다음 큰 릴리스까지) 모델 조정과 테스트는 끝난 것 같고, 다시 코딩으로 돌아갈 수 있을 것 같습니다."

대상 사용자

코딩 지원을 위해 로컬 LLM을 실행하는 개발자, 특히 AMD GPU(Vulkan)를 사용하여 비슷한 품질의 Copilot 대안을 원하는 분들.

📖 전체 출처 읽기: r/LocalLLaMA

Ad

👀 See Also

브레인스톰 MCP 서버, 클로드가 더 나은 답변을 위해 다른 LLM들과 코드 상담을 할 수 있게 합니다
Tools

브레인스톰 MCP 서버, 클로드가 더 나은 답변을 위해 다른 LLM들과 코드 상담을 할 수 있게 합니다

한 개발자가 Claude Code가 답변을 제공하기 전에 GPT-5.2 및 DeepSeek와 같은 다른 AI 모델과 상담할 수 있도록 하는 'brainstorm-mcp'라는 MCP 서버를 구축했습니다. 모델들은 서로의 응답을 읽고, 의견을 달리하며, 입장을 다듬어 더 나은 해결책에 수렴하는 다중 라운드 토론을 진행합니다.

OpenClawRadar
인공 생명: 계산 생명 연구의 300줄 파이썬 재현
Tools

인공 생명: 계산 생명 연구의 300줄 파이썬 재현

Computational Life 논문을 재현한 파이썬 구현체로, 240x135 그리드의 Brainfuck 유사 프로그램들이 무작위 쌍 구성과 명령어 테이프 연결을 통해 상호작용하며 자기복제 코드를 진화시킵니다.

OpenClawRadar
클로드 보이스: 클로드 코드용 단어 강조 기능이 포함된 로컬 TTS
Tools

클로드 보이스: 클로드 코드용 단어 강조 기능이 포함된 로컬 TTS

Claude-voice는 Claude Code의 음성 모드에 실시간 단어 하이라이트 기능이 포함된 로컬 텍스트 음성 변환을 추가하는 Python 도구입니다. 이 도구는 API 키 없이 완전히 로컬에서 실행되는 Kokoro TTS(8200만 매개변수)를 사용합니다.

OpenClawRadar
오픈소스 MCP 제품군이 Claude 코드 생성 품질을 15-20% 향상시킵니다
Tools

오픈소스 MCP 제품군이 Claude 코드 생성 품질을 15-20% 향상시킵니다

오픈소스 MCP 스위트는 세 개의 로컬 서버와 프롬프트 스킬로 구성되어 있으며, AI 코드 생성의 '나쁜 토큰' 문제를 해결합니다. 한 고객은 Claude Code의 품질이 15-20% 향상되었다고 보고했습니다.

OpenClawRadar