Сравнение производительности Qwen3.5-27B в 8-битном и 16-битном форматах

✍️ OpenClawRadar📅 Опубликовано: 20 апреля 2026 г.🔗 Source
Сравнение производительности Qwen3.5-27B в 8-битном и 16-битном форматах
Ad

Пользователь Reddit на r/LocalLLaMA поделился результатами тестирования, сравнивающими производительность Qwen3.5-27B с различными настройками точности.

Настройка теста и результаты

Пользователь протестировал две конфигурации:

  • Исходные веса bf16 с 16-битным KV-кэшем
  • 8-битная квантизация fp8 от Qwen с 8-битным KV-кэшем

Тесты проводились с использованием vLLM на видеокарте RTX 6000 Pro. В качестве бенчмарка использовался Aider benchmark. Пользователь сообщил о "практически идентичных результатах" между двумя конфигурациями, объясняя небольшие различия случайными погрешностями, поскольку каждая конфигурация была запущена только один раз.

Ad

Вывод и рекомендация

На основе результатов тестирования пользователь пришёл к выводу, что "следует использовать fp8 как для весов, так и для кэша". Основное преимущество, которое он отметил, заключается в том, что этот подход "значительно увеличит доступный объём контекста" благодаря снижению использования памяти за счёт меньшей точности.

Такое тестирование квантизации актуально для разработчиков, запускающих большие языковые модели локально, где ограничения памяти часто ограничивают размер окна контекста. Использование форматов с меньшей точностью, таких как fp8, может обеспечить большие окна контекста без значительного снижения производительности, как показывают эти предварительные результаты.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Смотрите также

Стелс-модель Healer Alpha от OpenRouter, по-видимому, является невыпущенным вариантом Qwen 3.5-Omni.
Новости

Стелс-модель Healer Alpha от OpenRouter, по-видимому, является невыпущенным вариантом Qwen 3.5-Omni.

OpenRouter развернул бесплатную анонимную омни-модальную модель под названием Healer Alpha с контекстным окном 262 144 токена и мультимодальными возможностями. Криминалистический анализ предполагает, что это невыпущенный вариант Qwen 3.5-Omni от Alibaba.

OpenClawRadar
ИИ уже убил академию в её привычном виде — Внутри игры на объём
Новости

ИИ уже убил академию в её привычном виде — Внутри игры на объём

Профессор с пожизненной должностью объясняет, как ИИ делает академический объем бесконечным: необнаружимые студенческие эссе, по статье в день и поток заявок на гранты, взламывающих систему. Игра больше не имеет смысла.

OpenClawRadar
Anthropic отключает OAuth-токены Claude Code для OpenClaw, требуя отдельной оплаты.
Новости

Anthropic отключает OAuth-токены Claude Code для OpenClaw, требуя отдельной оплаты.

Anthropic удаляет возможность использования токенов Claude Code CLI или долгоживущих OAuth-токенов со сторонними оболочками, такими как OpenClaw, начиная с 4 апреля. Пользователям потребуется включить дополнительное использование, которое будет оплачиваться отдельно от их подписки.

OpenClawRadar
Claude Code v2.1.133: откат worktree.baseRef, пути песочницы, исправление прокси для MCP OAuth
Новости

Claude Code v2.1.133: откат worktree.baseRef, пути песочницы, исправление прокси для MCP OAuth

Anthropic выпускает v2.1.133 Claude Code CLI с новой настройкой worktree.baseRef, по умолчанию равной fresh (ветка из origin/default), sandbox.bwrapPath и sandbox.socatPath для пользовательских бинарников bubblewrap/socat, исправлением proxy/mTLS для MCP OAuth потока и несколькими исправлениями ошибок.

OpenClawRadar