10.33 т/с на Qwen 3.5 35B с ноутбуком за $300: Полный разбор оптимизации

✍️ OpenClawRadar📅 Опубликовано: 14 июня 2026 г.🔗 Source
10.33 т/с на Qwen 3.5 35B с ноутбуком за $300: Полный разбор оптимизации
Ad

Пользователь Reddit разогнал инференс Qwen 3.5 35B до 10,33 т/с на ноутбуке Lenovo Ideapad Slim 3i за $300 (12-е поколение i3-1215U, 8 ГБ впаяно + 32 ГБ DDR4 расширение). В сборке используется квантованная модель MoE Q4_K_S с ~3 млрд активных параметров и сборка ik_llama.cpp 4509.

Железо и модель

  • Ноутбук: Lenovo Ideapad Slim 3i 2023 (~$300)
  • Процессор: Intel i3-1215U (6 ядер, используются 2 производительных)
  • ОЗУ: 8 ГБ впаяно + 32 ГБ DDR4 SO-DIMM (Flex mode)
  • ОС: Linux Mint
  • Модель: Qwen3.5-35B-A3B-uncensored-heretic-v2-Native-MTP-Preserved-Q4_K_S.gguf (35B MoE, 3B активных параметров на токен)
  • Бэкенд: ik_llama.cpp коммит 40aae0b6, скомпилирован GCC 13.3.0

Применённые оптимизации

  • BIOS: Battery → Extreme performance mode; вентилятор выключен
  • Профиль питания ОС: производительность
  • Привязка ядер: потоки привязаны к производительным ядрам 0 и 2 через taskset -c 0,2
  • Квантование: Q4_K_S
  • Размер пакета: 64 (-ub 64)
  • Спекулятивное декодирование: тип MTP, макс. 3 черновика
  • Flash attention, fmoe, rtr — все включены по умолчанию
  • Чистая перезагрузка перед тестом
Ad

Использованная команда

taskset -c 0,2 ./build/bin/llama-cli \
  -m "/home/default/LLM Models/Qwen3.5-35B-A3B-uncensored-heretic-v2-Native-MTP-Preserved-Q4_K_S.gguf" \
  -p "User: Please explain the history of france \nAI:" \
  -n 1028 \
  --spec-type mtp \
  --draft-max 3 \
  -t 2 \
  -ub 64 \
  --temp 1.0 \
  --top-p 0.95 \
  --top-k 20 \
  --min-p 0.0 \
  --presence-penalty 1.5 \
  --repeat-penalty 1.0

Результаты

  • Промпт: 22,49 т/с
  • Инференс: 10,33 т/с (на 1028 токенах)
  • Температура: ~90°C, ограничение по мощности не требуется с ik_llama (ранее требовался лимит 17,5 Вт на llama.cpp)

Почему Qwen 3.5 MoE быстр

Архитектура Qwen 3.5 35B MoE активирует только ~3 млрд параметров на токен, в отличие от плотных моделей. Для сравнения, Gemma 4 26b (4B активных) выдавала лишь ~3 т/с при аналогичных настройках — это указывает на то, что маршрутизация MoE и разреженные вычисления в Qwen 3.5 особенно дружественны к CPU.

Потенциальные улучшения

  • Кастомный BIOS для таймингов памяти XMP → +10% т/с
  • Замена термопасты на высококачественную
  • Переход с DDR4 на DDR5 (в сочетании с заменой пасты → +20% т/с)

Для кого это: Разработчики, запускающие локальные LLM на бюджетном железе и желающие выжать максимум производительности из моделей Qwen MoE при инференсе только на CPU.

📖 Source: r/LocalLLaMA

Ad

👀 Смотрите также

Обновление AgentCrawl добавляет важные функции и улучшения для паука.
Инструменты

Обновление AgentCrawl добавляет важные функции и улучшения для паука.

Последнее обновление AgentCrawl вводит такие функции, как соблюдение robots.txt, кэширование на диске, возможность возобновления обходов и извлечение структурированных метаданных, превращая его в более надежный инструмент, готовый к производственному использованию.

OpenClawRadar
КОЛЛЕКЦИЯ АГЕНТОВ: 129 Клод-код-агентов собраны в одном репозитории
Инструменты

КОЛЛЕКЦИЯ АГЕНТОВ: 129 Клод-код-агентов собраны в одном репозитории

Разработчик собрал 129 агентов Claude Code в единый репозиторий в формате ~/.claude/agents/, готовый к установке простой командой копирования. Коллекция включает полную систему agency-agents с 68 личностно-ориентированными агентами из различных областей, а также дополнительные агенты для многозадачных рабочих процессов.

OpenClawRadar
Сравнение мультиагентных систем ИИ: Harness от Anthropic и модель инженерной организации Agyn
Инструменты

Сравнение мультиагентных систем ИИ: Harness от Anthropic и модель инженерной организации Agyn

Anthropic опубликовала дизайн фреймворка для разработки долгоиграющих приложений, в то время как мультиагентная система Agyn для командной автономной разработки ПО была открыта в прошлом месяце. Обе системы отвергают монолитные агенты в пользу разделения ролей, структурированных передач и циклов проверки.

OpenClawRadar
GuppyLM: 9-миллионная языковая модель, созданная с нуля для образовательных целей
Инструменты

GuppyLM: 9-миллионная языковая модель, созданная с нуля для образовательных целей

GuppyLM — это языковая модель с примерно 9 миллионами параметров, обученная с нуля на 60 тысячах синтетических диалогов, использующая стандартную архитектуру трансформера с 6 слоями, 384 скрытыми измерениями и 6 головами внимания. Она обучается примерно за 5 минут на бесплатном GPU T4 в Colab и говорит с рыбьей личностью, сосредоточенной на воде, еде и жизни в аквариуме.

OpenClawRadar