Qwen 3.5 35B, работающий на 8 ГБ видеопамяти с конфигурацией llama.cpp

Локальная настройка Qwen 3.5 35B при ограниченной видеопамяти
Разработчик на r/LocalLLaMA подробно описал свою конфигурацию для локального запуска модели Qwen 3.5 35B на оборудовании с 8 ГБ видеопамяти. Он перешёл с использования Antigravity (с планом Google AI Pro) на локальные LLM после достижения лимитов облачного сервиса.
Характеристики оборудования и модели
Настройка использует ноутбук Lenovo Legion с процессором i9-14900HX (с отключёнными E-ядрами в BIOS, 32 ГБ оперативной памяти DDR5) и видеокартой RTX 4060m с 8 ГБ видеопамяти. Конкретная модель — Qwen 3.5 35B A3B Heretic Opus (Q4_K_M GGUF).
Производительность и конфигурация llama.cpp
Разработчик сообщает о достижении примерно 700 токенов в секунду при обработке промптов и 42 токена в секунду при генерации токенов с этой настройкой. После тестирования он предоставил свои аргументы командной строки для llama.cpp:
-ngl 99 ^ --n-cpu-moe 40 ^ -c 192000 ^ -t 12 ^ -tb 16 ^ -b 4096 ^ --ubatch-size 2048 ^ --flash-attn on ^ --cache-type-k q8_0 ^ --cache-type-v q8_0 ^ --mlock
Интеграция в рабочий процесс
Для своего агентского рабочего процесса он нашёл, что Cline в VSCode является наиболее близкой альтернативой Antigravity. В этой настройке он использует kat-coder-pro для режима Plan и qwen3.5 для режима Act. Разработчик ищет отзывы о том, лучше ли эта локальная конфигурация, чем продолжение использования Google Gemini 3 Flash в Antigravity, отмечая, что для него приоритетом является плавность рабочего процесса, а не вопросы конфиденциальности.
📖 Read the full source: r/LocalLLaMA
👀 Смотрите также

OpenHelm: Приложение для macOS для автоматизации задач кодирования с помощью Claude
OpenHelm — это бесплатное локальное приложение для macOS, которое автоматизирует повторяющиеся задачи кодирования в Claude, запуская задания по расписанию, автоматически повторяя неудачные попытки и разбивая работу на части, чтобы избежать ограничений сессий. Оно использует вашу существующую подписку Claude для вызовов LLM.

Открытая веб-панель отслеживает использование токенов Claude для удаленных рабочих процессов.
Разработчик создал react-ai-token-monitor — легковесную веб-панель, которая анализирует локальные файлы проектов Claude в реальном времени для расчета затрат, отображения распределения по моделям и отслеживания паттернов использования. Инструмент показал, что в марте 2026 года на плане Max 20x было использовано токенов Claude на сумму $4,808.

Переписанные навыки программирования Карпати для бесплатного плана открывают дисциплину кодирования Claude без Pro
Пользователь Reddit адаптировал руководство по дисциплине кодирования Карпати для бесплатного плана Claude, удалив зависимости от терминала и подагентов. Системный промпт автоматически срабатывает на запросы кода и стимулирует мышление, ориентированное на проверку.

4-слойная система самопроверки для поведенческой эволюции OpenClaw
Разработчик создал 4-уровневую систему аудита, в которой Gemini еженедельно проверяет слепые зоны Claude, выявляя паттерны, которые Claude пропустил при самопроверке. Система включает проверку после исправления, анализ паттернов, внешнее зеркалирование и сравнение ожиданий с реальностью.