Результаты тестирования моделей Qwen3.5 с контекстом от 2K до 400K на RTX 4090

✍️ OpenClawRadar📅 Опубликовано: 7 марта 2026 г.🔗 Source
Результаты тестирования моделей Qwen3.5 с контекстом от 2K до 400K на RTX 4090
Ad

Тестирование производительности Qwen3.5 на RTX 4090

Разработчик поделился результатами бенчмарков для моделей Qwen3.5, запущенных на видеокарте RTX 4090, протестировав размеры контекста от 2 048 до 400 000 токенов. Изначально тесты планировались для контекста в 262 тыс. токенов, но были расширены до 400 тыс. с использованием yarn и других методов.

Протестированные модели

Были протестированы следующие варианты моделей Qwen3.5:

  • Qwen3.5-0.8B-Q4_K_M
  • Qwen3.5-0.8B-bf16
  • Qwen3.5-2B-Q4_K_M
  • Qwen3.5-2B-bf16
  • Qwen3.5-4B-Q4_K_M
  • Qwen3.5-4B-bf16
  • Qwen3.5-9B-Q4_K_M
  • Qwen3.5-9B-bf16
  • Qwen3.5-27B-Q4_K_M
  • Qwen3.5-35B-A3B-Q4_K_M

Протестированные размеры контекста

Модели оценивались при следующих конкретных длинах контекста: 2048, 4096, 8192, 32768, 65536, 98304, 131072, 196608, 262144, 327680, 360448, 393216 и 400000 токенов.

Ad

Методология тестирования

Скрипт бенчмарка был настроен для достижения максимально возможной скорости в токенах/секунду с использованием настроек NGL с 8-битным и 4-битным KV-кэшем. Разработчик отметил, что хотя начальное время до первого токена (TTFT) кажется длительным, столбец Warm TTFT Avg (s) показывает лучшую производительность после загрузки KV-кэша. Контекст был полностью загружен при первом взаимодействии намеренно.

Для проверки возможностей контекста моделям давался промпт из одного предложения для суммирования логов, за которым следовали логовые данные объёмом от 2 тыс. до 400 тыс. токенов. Разработчик сообщил о некоторых расхождениях, но в целом удовлетворительной производительности.

Текущий статус и следующие шаги

Три модели не прошли тестирование и проходят тесты с выгрузкой KV-кэша: Qwen3.5-4B-bf16, Qwen3.5-27B-Q4_K_M и Qwen3.5-35B-A3B-Q4_K_M. Разработчику пришлось перезапустить эти тесты после проблемы со скриптом, которая потратила 24 часа времени выполнения.

После завершения тестов с выгрузкой VRAM разработчик планирует сравнить результаты с базовыми моделями и сохранил выводы для анализа. Разработчик выразил особое удивление производительностью плотных моделей 9B и 27B.

Разработчик ищет мнение сообщества о том, с какими моделями сравнивать и какую методологию оценки использовать для градации.

📖 Read the full source: r/openclaw

Ad

👀 Смотрите также

Трафик сабреддита r/ClaudeAI резко вырос с 500 тысяч до 1,9 миллиона посетителей в неделю.
Новости

Трафик сабреддита r/ClaudeAI резко вырос с 500 тысяч до 1,9 миллиона посетителей в неделю.

Подреддит r/ClaudeAI вырос примерно с 250 тысяч посетителей в неделю в ноябре 2025 года до 1,9 миллиона в марте 2026 года, при этом количество подписчиков осталось на уровне около 85 тысяч пользователей.

OpenClawRadar
🦀
Новости

Акции Alphabet теряют $700 млрд на фоне роста счетов за ИИ

Акции Alphabet упали на 15% от майского пика, потеряв около 700 млрд долларов рыночной стоимости. Инвесторы обеспокоены ростом затрат на ИИ и задержками Gemini, а соучредитель Сергей Брин возвращается к управлению.

OpenClawRadar
🦀
Новости

Мнение UX-дизайнера: Дизайн Claude не может заменить опытных дизайнеров

UX-дизайнер утверждает, что Claude Design переоценен и полезен только для не-дизайнеров, чтобы прототипировать идеи, начинающих стартапов и портфолио для новичков.

OpenClawRadar
Утечка кода Claude раскрывает систему KAIROS и пробел в верификации ИИ-агентов
Новости

Утечка кода Claude раскрывает систему KAIROS и пробел в верификации ИИ-агентов

Утечка карты исходного кода Claude Code показала 512 тысяч строк TypeScript, 44 флажка функций и KAIROS — фоновый агент, который консолидирует память в периоды простоя. Независимый разработчик создал аналогичный демон для объединения сессий в многодневные кампании, но обнаружил, что успешная компиляция не гарантирует работоспособность кода.

OpenClawRadar