Qwen 3.6-35B-A3B KV Cache тестирование: f16 vs q8_0 vs Turbo3 vs Turbo4 на M5 Max до 1M контекста

✍️ OpenClawRadar📅 Опубликовано: 28 апреля 2026 г.🔗 Source
Qwen 3.6-35B-A3B KV Cache тестирование: f16 vs q8_0 vs Turbo3 vs Turbo4 на M5 Max до 1M контекста
Ad

Пользователь Reddit провёл sweep по глубине на Qwen 3.6-35B-A3B Q8 с использованием TheTom's TurboQuant Metal форка llama.cpp (GitHub: TheTom/llama-cpp-turboquant, ветка feature/turboquant-kv-cache) на MacBook Pro M5 Max с 128 ГБ унифицированной памяти. Он протестировал четыре типа KV-кэша: f16, q8_0, turbo3 (3-битный) и turbo4 (4-битный), симметричные K и V, с включёнными flash-attn и mlock, от 0 до 1M токенов контекста.

Оборудование и сборка

M5 Max, 128 ГБ унифицированной памяти. Собрано с cmake -B build -DGGML_METAL=ON. Использовался llama-bench, 3 повтора на ячейку, flash-attn включён, mlock включён. 8 часов реального времени за ночь.

Пропускная способность генерации (ток/с)

Глубинаf16q8_0turbo3turbo4
089.487.479.579.7
8K84.279.272.271.2
32K72.667.861.561.8
128K44.440.736.037.7
256KOOM26.622.925.5
512KOOMOOM13.316.0
1MOOMOOM6.5OOM

Пропускная способность обработки промптов (ток/с)

Глубинаf16q8_0turbo3turbo4
02962294829042854
8K2098162316531439
32K1063802784678
128K321245253206
256KOOM124128101
512KOOMOOM6656
1MOOMOOM30OOM
Ad

Ключевые выводы

  • На глубине 0 f16 немного опережает по префиллу; turbo3 примерно на 10% медленнее при декодировании.
  • На 128K префилл turbo3 (253 ток/с) сравнивается с q8_0 (245 ток/с) — меньший кэш снижает нагрузку на пропускную способность.
  • На 256K turbo3 выигрывает в префилле на 27% по сравнению с turbo4 (128 против 101), но turbo4 выигрывает в декодировании на 11% (25.5 против 22.9). На 512K разница в декодировании увеличивается до +20% (turbo4 16.0 против turbo3 13.3).
  • turbo3 — единственный тип кэша, который помещается в 1M контекст (6.5 ток/с декодирования). Память на 1M: ~89 ГБ (37 ГБ веса, ~52 ГБ KV-кэш).

Рекомендации по нагрузкам

  • Кодинг-агенты (глубокий контекст, много генерируемых токенов): turbo4
  • RAG / пакетные вопросы-ответы (тяжёлый префилл, короткие ответы): turbo3
  • Контекст 1M: только turbo3
  • Короткие интерактивные сессии (<32K): f16, если помещается, иначе q8_0

Оговорки

Это только один M5 Max. Точки пересечения могут смещаться в зависимости от пропускной способности памяти и количества ядер GPU. Протестированы только симметричные K/V. Асимметричные комбинации (например, -ctk q8_0 -ctv turbo4) не тестировались. Форк TheTom — исследовательского уровня, не включён в основную ветку llama.cpp.

📖 Полный источник: r/LocalLLaMA

Ad

👀 Смотрите также

Платформа Claude на AWS теперь общедоступна: нативный опыт Anthropic через IAM, CloudTrail и AWS Billing
Новости

Платформа Claude на AWS теперь общедоступна: нативный опыт Anthropic через IAM, CloudTrail и AWS Billing

AWS объявила о GA платформы Claude на AWS, предоставляя разработчикам прямой доступ к нативному опыту Anthropic Claude через существующие аккаунты AWS с аутентификацией IAM, биллингом AWS и логированием CloudTrail — но пользовательские данные обрабатываются за пределами границ безопасности AWS.

OpenClawRadar
Провайдер OpenClaw Mistral не работает после обновления 2026.3.8, сообщество ищет альтернативы.
Новости

Провайдер OpenClaw Mistral не работает после обновления 2026.3.8, сообщество ищет альтернативы.

Пользователи OpenClaw сообщают о постоянных ошибках HTTP 422 с моделями Mistral после обновления до версии 2026.3.8, и проблема не была устранена в последующих релизах вплоть до 2026.3.13. Ошибка затрагивает весь функционал, связанный с Mistral, в то время как прямые вызовы API работают нормально.

OpenClawRadar
Anthropic запускает удалённое управление для кода Claude
Новости

Anthropic запускает удалённое управление для кода Claude

Anthropic запустила функцию удаленного управления для Claude Code, позволяя пользователям продолжать сессии программирования с мобильных устройств. Функция описана на code.claude.com/docs/en/remote-control.

OpenClawRadar
Параметр Claude Opus 4.6 effort=low вызывает ленивое поведение агента.
Новости

Параметр Claude Opus 4.6 effort=low вызывает ленивое поведение агента.

При использовании effort=low в Claude Opus 4.6 агенты совершали меньше вызовов инструментов, были менее тщательными в перекрёстной проверке и игнорировали части системных промптов о веб-исследованиях. Переключение на effort=medium решило эти проблемы.

OpenClawRadar