Сравнение производительности Qwen3.5-27B в 8-битном и 16-битном форматах

✍️ OpenClawRadar📅 Опубликовано: 20 апреля 2026 г.🔗 Source
Сравнение производительности Qwen3.5-27B в 8-битном и 16-битном форматах
Ad

Пользователь Reddit на r/LocalLLaMA поделился результатами тестирования, сравнивающими производительность Qwen3.5-27B с различными настройками точности.

Настройка теста и результаты

Пользователь протестировал две конфигурации:

  • Исходные веса bf16 с 16-битным KV-кэшем
  • 8-битная квантизация fp8 от Qwen с 8-битным KV-кэшем

Тесты проводились с использованием vLLM на видеокарте RTX 6000 Pro. В качестве бенчмарка использовался Aider benchmark. Пользователь сообщил о "практически идентичных результатах" между двумя конфигурациями, объясняя небольшие различия случайными погрешностями, поскольку каждая конфигурация была запущена только один раз.

Ad

Вывод и рекомендация

На основе результатов тестирования пользователь пришёл к выводу, что "следует использовать fp8 как для весов, так и для кэша". Основное преимущество, которое он отметил, заключается в том, что этот подход "значительно увеличит доступный объём контекста" благодаря снижению использования памяти за счёт меньшей точности.

Такое тестирование квантизации актуально для разработчиков, запускающих большие языковые модели локально, где ограничения памяти часто ограничивают размер окна контекста. Использование форматов с меньшей точностью, таких как fp8, может обеспечить большие окна контекста без значительного снижения производительности, как показывают эти предварительные результаты.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Смотрите также

Claude Code v2.1.79: Сбой OAuth-авторизации после автоматического обновления: Обходное решение и исправление
Новости

Claude Code v2.1.79: Сбой OAuth-авторизации после автоматического обновления: Обходное решение и исправление

В Claude Code v2.1.79 обнаружен подтверждённый баг с авторизацией OAuth, из-за которого CLI зависает после подтверждения в браузере. Проблема возникает из-за автоматического обновления через нативный установщик до этой версии, а исправление требует отката до v2.1.75 путём удаления нативной установки.

OpenClawRadar
Эффективность токенов Opus 4.7: немецкие промпты расходуют до 2 раз больше токенов по сравнению с английскими
Новости

Эффективность токенов Opus 4.7: немецкие промпты расходуют до 2 раз больше токенов по сравнению с английскими

Подписчик Claude Pro сообщает, что использование немецкого языка с Opus 4.7 израсходовало 100% токенов сессии за секунды, в то время как английский использовал 37%. Неэффективность токенизатора обусловлена сложными существительными и умлаутами, что приводит к 1,5–2-кратному расходу токенов.

OpenClawRadar
Anthropic отключает OAuth-токены Claude Code для OpenClaw, требуя отдельной оплаты.
Новости

Anthropic отключает OAuth-токены Claude Code для OpenClaw, требуя отдельной оплаты.

Anthropic удаляет возможность использования токенов Claude Code CLI или долгоживущих OAuth-токенов со сторонними оболочками, такими как OpenClaw, начиная с 4 апреля. Пользователям потребуется включить дополнительное использование, которое будет оплачиваться отдельно от их подписки.

OpenClawRadar
Godot запрещает вклад AI-сгенерированного кода: «Мы не можем доверять активным пользователям ИИ»
Новости

Godot запрещает вклад AI-сгенерированного кода: «Мы не можем доверять активным пользователям ИИ»

Игровой движок Godot больше не будет принимать код, написанный ИИ, ссылаясь на то, что активные пользователи ИИ не могут понять свой код, чтобы исправить его.

OpenClawRadar