Запуск Qwen3.6-35B-A3B-UD-Q5_K_XL локально с VS Code Copilot на AMD R9700

✍️ OpenClawRadar📅 Опубликовано: 7 мая 2026 г.🔗 Source
Запуск Qwen3.6-35B-A3B-UD-Q5_K_XL локально с VS Code Copilot на AMD R9700
Ad

Пользователь Reddit сообщает об отличных результатах локального запуска GGUF модели Qwen3.6-35B-A3B-UD-Q5_K_XL с помощью llama.cpp на Vulkan на одном GPU AMD R9700. Эта конфигурация стала заменой GitHub Copilot в VS Code, сгенерировав полноценный тестовый сайт и набор тестов Playwright с минимальным вмешательством.

Команда запуска llama.cpp

/app/llama-server -m /models/Qwen3.6-35B-A3B-UD-Q5_K_XL/Qwen3.6-35B-A3B-UD-Q5_K_XL.gguf \
  --ctx-size 262144 --threads 8 --threads-batch 8 \
  --gpu-layers 99 --parallel 1 --flash-attn on \
  --batch-size 2048 --ubatch-size 1024 \
  --cache-type-k q8_0 --cache-type-v q8_0 \
  --cache-ram 12000 --ctx-checkpoints 50 \
  --mmap --no-mmproj --kv-unified \
  --reasoning off --reasoning-budget 0 --jinja \
  --temp 0.6 --top-k 20 --top-p 0.95 --min-p 0.0 \
  --repeat-penalty 1.0 --presence-penalty 0.0

Ключевые параметры: контекст 256K, 99 слоев GPU для полной выгрузки, включен flash attention, а sampling настройки взяты со страницы Qwen3.6-35B-A3B на Hugging Face в разделе "precise coding".

Ad

Интеграция с VS Code

Пользователь настроил кастомную чат-модель в chatLanguageModels.json, указав локальный сервер llama.cpp:

{
  "name": "Sean Llama.cpp",
  "vendor": "customoai",
  "apiKey": "${input:chat.lm.secret.3c0c0f21}",
  "models": [
    {
      "id": "Qwen3.6-35B-A3B-UD-Q5_K_XL.gguf",
      "name": "Qwen3.6-35B",
      "url": "https://llm.home.arpa/v1/chat/completions",
      "toolCalling": true,
      "vision": false,
      "maxInputTokens": 180000,
      "maxOutputTokens": 10000,
      "family": "Qwen3",
      "inputTokenCost": 0.0001,
      "outputTokenCost": 0.0001,
      "temperature": 0.6,
      "top_p": 0.95,
      "top_k": 20,
      "repeat_penalty": 1,
      "presence_penalty": 0,
      "frequency_penalty": 0,
      "systemMessage": "Вы — точный ассистент по программированию. Избегайте повторения планов. Выполняйте задачи напрямую. Не формулируйте намерения несколько раз.",
      "timeout": 600000,
      "retry": { "enabled": true, "max_attempts": 2, "interval_ms": 1500 }
    }
  ]
}

Модель корректно отвечала на запросы вызова инструментов, что позволило ей стать заменой Copilot.

Реальный тест: генерация полного стека

Пользователь отправил подробный запрос (изначально из ChatGPT) на создание "Bike Shop Service Tracker" — локального приложения на React + TypeScript с localStorage. Требования включали модель данных, начальные данные, фильтрацию, сортировку и валидацию форм. Модель сгенерировала полностью рабочий сайт с первой попытки.

Затем пользователь попросил сгенерировать полный набор тестов Playwright. Только один тест потребовал ручной правки — остальные сработали без ошибок. Вывод пользователя: "Думаю, я закончил настройку и тестирование моделей (до следующего крупного релиза) и могу вернуться к кодингу."

Для кого это

Разработчики, запускающие локальные LLM для помощи в кодинге, особенно с GPU AMD (Vulkan), которые хотят альтернативу Copilot с сопоставимым качеством.

📖 Читать полный источник: r/LocalLLaMA

Ad

👀 Смотрите также

Пневма: Сгенерированная ИИ среда рабочего стола, где программы материализуются из описаний
Инструменты

Пневма: Сгенерированная ИИ среда рабочего стола, где программы материализуются из описаний

Pneuma — это вычислительная среда для настольных компьютеров, в которой вы описываете, что вам нужно — монитор ЦП, игру, приложение для заметок или визуализатор данных — и рабочая программа появляется за считанные секунды. Система генерирует автономные модули на Rust, компилирует их в WebAssembly и выполняет в изолированных экземплярах Wasmtime с GPU-рендерингом через wgpu.

OpenClawRadar
ClawMetry добавляет удаленный мониторинг со сквозным шифрованием для агентов OpenClaw.
Инструменты

ClawMetry добавляет удаленный мониторинг со сквозным шифрованием для агентов OpenClaw.

ClawMetry v0.1.0 теперь включает облачную синхронизацию для удаленного мониторинга агентов OpenClaw из любого браузера или приложения в строке меню Mac, со сквозным шифрованием, которое сохраняет данные зашифрованными до их получения вашим клиентом.

OpenClawRadar
ClawProxy: Самостоятельно размещаемый прокси-маршрутизатор для ротации бесплатных API-ключей
Инструменты

ClawProxy: Самостоятельно размещаемый прокси-маршрутизатор для ротации бесплатных API-ключей

ClawProxy — это самодостаточный прокси-маршрутизатор для ИИ, который управляет несколькими бесплатными ключами API ИИ, чтобы избежать ограничений по частоте запросов и перегрузки провайдеров. Он включает ротацию ключей на лету, взвешенную балансировку нагрузки, трансляцию моделей и панель управления с глубоко проанализированными логами.

OpenClawRadar
Sponsio: Детерминированные защитные барьеры для OpenClaw — блокировка «легальных, но неправильных» вызовов инструментов
Инструменты

Sponsio: Детерминированные защитные барьеры для OpenClaw — блокировка «легальных, но неправильных» вызовов инструментов

Инструмент с открытым исходным кодом, который располагается на границе инструментов и оценивает каждый вызов с помощью контрактов темпоральной логики (~0,14 ms p50). Запрещает агентам редактировать файлы за пределами рабочего каталога, выполнять force-push или запускать миграции в неправильной базе данных.

OpenClawRadar