Бенчмарк квантизации Qwen 3.6 27B: Q4_K_M превосходит Q8_0 по практическим компромиссам

✍️ OpenClawRadar📅 Опубликовано: 28 апреля 2026 г.🔗 Source
Бенчмарк квантизации Qwen 3.6 27B: Q4_K_M превосходит Q8_0 по практическим компромиссам
Ad

Пользователь Reddit протестировал Qwen 3.6 27B в трех вариантах квантования GGUF (BF16, Q4_K_M, Q8_0) с использованием llama-cpp-python через фреймворк Neo AI Engineer. Оценка охватывала 664 образца по трем задачам: HumanEval (генерация кода, 164 образца), HellaSwag (здравый смысл, 100 образцов) и BFCL (вызов функций, 400 образцов).

Результаты бенчмарка

  • BF16 (размер модели 53,8 ГБ, пиковая RAM 54 ГБ, пропускная способность 15,5 ток/с): HumanEval 56,10% (92/164), HellaSwag 90,00% (90/100), BFCL 63,25% (253/400). Средняя точность: 69,78%.
  • Q4_K_M (16,8 ГБ, 28 ГБ RAM, 22,5 ток/с): HumanEval 50,61% (83/164), HellaSwag 86,00% (86/100), BFCL 63,00% (252/400). Средняя: 66,54%.
  • Q8_0 (28,6 ГБ, 42 ГБ RAM, 18,0 ток/с): HumanEval 52,44% (86/164), HellaSwag 83,00% (83/100), BFCL 63,00% (252/400). Средняя: 66,15%.
Ad

Основные выводы

Q4_K_M — лучший практический вариант. Он сохраняет точность BFCL (63,00% против 63,25%), теряет всего ~5,5 пункта на HumanEval и отстает от BF16 на ~4 пункта по HellaSwag. Компромиссы: в 1,45 раза быстрее BF16, на 48% меньше пиковой RAM, на 68,8% меньше файл и практически идентичная производительность вызова функций. Q8_0 разочаровал: он улучшил HumanEval всего на ~1,8 пункта по сравнению с Q4_K_M, но использовал 42 ГБ RAM против 28 ГБ, был медленнее и показал более низкие результаты по HellaSwag.

Для локального/CPU развертывания рекомендуется Q4_K_M, если только нагрузка не сосредоточена на генерации кода. Для максимального качества по-прежнему лучшим является BF16.

Настройка оценки

Варианты GGUF через llama-cpp-python с n_ctx: 32768, чекпоинтированная оценка. Фреймворк Neo AI Engineer построил конвейер оценки GGUF, обработал чекпоинтированные запуски и объединил результаты. Полное тематическое исследование с фрагментами кода приведено в оригинальных комментариях Reddit.

📖 Читать полный источник: r/LocalLLaMA

Ad

👀 Смотрите также

Rever UI Cloner: AI-оптимизированная альтернатива HTML-скрапингу для репликации пользовательского интерфейса
Инструменты

Rever UI Cloner: AI-оптимизированная альтернатива HTML-скрапингу для репликации пользовательского интерфейса

Rever UI Cloner — это API-эндпоинт, который предоставляет AI-агентам чистые дизайн-макеты вместо сырого HTML, избегая переполнения контекстного окна и проблем с галлюцинациями интерфейса. Он использует платёжный протокол x402, требующий микроплатежа в размере 1 USDC в сети Base для оплаты между агентами.

OpenClawRadar
ddash: Инструмент для создания диаграмм Mermaid с URL-хранилищем и интеграцией кода Claude
Инструменты

ddash: Инструмент для создания диаграмм Mermaid с URL-хранилищем и интеграцией кода Claude

ddash — это бесплатный инструмент для создания диаграмм Mermaid, где вся диаграмма сжимается в хэш URL, не требуя бэкенда, аккаунтов или хранилища. Он включает навык Claude Code, который позволяет генерировать и открывать диаграммы прямо во время разговоров с помощью команд вроде /diagram the auth flow.

OpenClawRadar
Новичковая сборка для живого режима: ваш первый агент OpenClaw
Инструменты

Новичковая сборка для живого режима: ваш первый агент OpenClaw

Ведущие The Clawcast проводят прямую трансляцию для новичков 8 июля, показывая, как настроить агента OpenClaw без навыков программирования. Присоединяйтесь в Discord или смотрите запись на OpenClawYT.

OpenClawRadar
Система Торгового Совета с Мульти-Агентами на основе GPT-5.1 и Claude 4.6
Инструменты

Система Торгового Совета с Мульти-Агентами на основе GPT-5.1 и Claude 4.6

Разработчик создал многокомпонентную торговую систему, использующую ZagiHQ для оркестрации с тремя параллельными агентами сбора данных и тремя LLM (GPT-5.1, Claude 4.6 Opus, Claude 4.6 Sonnet), которые должны согласовывать сделки. Система отсеивает торговые сетапы через несогласие и требует ручного подтверждения.

OpenClawRadar