Qwen 3.5 35B, работающий на 8 ГБ видеопамяти с конфигурацией llama.cpp

✍️ OpenClawRadar📅 Опубликовано: 27 марта 2026 г.🔗 Source
Qwen 3.5 35B, работающий на 8 ГБ видеопамяти с конфигурацией llama.cpp
Ad

Локальная настройка Qwen 3.5 35B при ограниченной видеопамяти

Разработчик на r/LocalLLaMA подробно описал свою конфигурацию для локального запуска модели Qwen 3.5 35B на оборудовании с 8 ГБ видеопамяти. Он перешёл с использования Antigravity (с планом Google AI Pro) на локальные LLM после достижения лимитов облачного сервиса.

Характеристики оборудования и модели

Настройка использует ноутбук Lenovo Legion с процессором i9-14900HX (с отключёнными E-ядрами в BIOS, 32 ГБ оперативной памяти DDR5) и видеокартой RTX 4060m с 8 ГБ видеопамяти. Конкретная модель — Qwen 3.5 35B A3B Heretic Opus (Q4_K_M GGUF).

Производительность и конфигурация llama.cpp

Разработчик сообщает о достижении примерно 700 токенов в секунду при обработке промптов и 42 токена в секунду при генерации токенов с этой настройкой. После тестирования он предоставил свои аргументы командной строки для llama.cpp:

-ngl 99 ^
--n-cpu-moe 40 ^
-c 192000 ^
-t 12 ^
-tb 16 ^
-b 4096 ^
--ubatch-size 2048 ^
--flash-attn on ^
--cache-type-k q8_0 ^
--cache-type-v q8_0 ^
--mlock
Ad

Интеграция в рабочий процесс

Для своего агентского рабочего процесса он нашёл, что Cline в VSCode является наиболее близкой альтернативой Antigravity. В этой настройке он использует kat-coder-pro для режима Plan и qwen3.5 для режима Act. Разработчик ищет отзывы о том, лучше ли эта локальная конфигурация, чем продолжение использования Google Gemini 3 Flash в Antigravity, отмечая, что для него приоритетом является плавность рабочего процесса, а не вопросы конфиденциальности.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Смотрите также

OpenHelm: Приложение для macOS для автоматизации задач кодирования с помощью Claude
Инструменты

OpenHelm: Приложение для macOS для автоматизации задач кодирования с помощью Claude

OpenHelm — это бесплатное локальное приложение для macOS, которое автоматизирует повторяющиеся задачи кодирования в Claude, запуская задания по расписанию, автоматически повторяя неудачные попытки и разбивая работу на части, чтобы избежать ограничений сессий. Оно использует вашу существующую подписку Claude для вызовов LLM.

OpenClawRadar
Открытая веб-панель отслеживает использование токенов Claude для удаленных рабочих процессов.
Инструменты

Открытая веб-панель отслеживает использование токенов Claude для удаленных рабочих процессов.

Разработчик создал react-ai-token-monitor — легковесную веб-панель, которая анализирует локальные файлы проектов Claude в реальном времени для расчета затрат, отображения распределения по моделям и отслеживания паттернов использования. Инструмент показал, что в марте 2026 года на плане Max 20x было использовано токенов Claude на сумму $4,808.

OpenClawRadar
Переписанные навыки программирования Карпати для бесплатного плана открывают дисциплину кодирования Claude без Pro
Инструменты

Переписанные навыки программирования Карпати для бесплатного плана открывают дисциплину кодирования Claude без Pro

Пользователь Reddit адаптировал руководство по дисциплине кодирования Карпати для бесплатного плана Claude, удалив зависимости от терминала и подагентов. Системный промпт автоматически срабатывает на запросы кода и стимулирует мышление, ориентированное на проверку.

OpenClawRadar
4-слойная система самопроверки для поведенческой эволюции OpenClaw
Инструменты

4-слойная система самопроверки для поведенческой эволюции OpenClaw

Разработчик создал 4-уровневую систему аудита, в которой Gemini еженедельно проверяет слепые зоны Claude, выявляя паттерны, которые Claude пропустил при самопроверке. Система включает проверку после исправления, анализ паттернов, внешнее зеркалирование и сравнение ожиданий с реальностью.

OpenClawRadar