Результаты тестирования моделей Qwen3.5 с контекстом от 2K до 400K на RTX 4090

Тестирование производительности Qwen3.5 на RTX 4090
Разработчик поделился результатами бенчмарков для моделей Qwen3.5, запущенных на видеокарте RTX 4090, протестировав размеры контекста от 2 048 до 400 000 токенов. Изначально тесты планировались для контекста в 262 тыс. токенов, но были расширены до 400 тыс. с использованием yarn и других методов.
Протестированные модели
Были протестированы следующие варианты моделей Qwen3.5:
- Qwen3.5-0.8B-Q4_K_M
- Qwen3.5-0.8B-bf16
- Qwen3.5-2B-Q4_K_M
- Qwen3.5-2B-bf16
- Qwen3.5-4B-Q4_K_M
- Qwen3.5-4B-bf16
- Qwen3.5-9B-Q4_K_M
- Qwen3.5-9B-bf16
- Qwen3.5-27B-Q4_K_M
- Qwen3.5-35B-A3B-Q4_K_M
Протестированные размеры контекста
Модели оценивались при следующих конкретных длинах контекста: 2048, 4096, 8192, 32768, 65536, 98304, 131072, 196608, 262144, 327680, 360448, 393216 и 400000 токенов.
Методология тестирования
Скрипт бенчмарка был настроен для достижения максимально возможной скорости в токенах/секунду с использованием настроек NGL с 8-битным и 4-битным KV-кэшем. Разработчик отметил, что хотя начальное время до первого токена (TTFT) кажется длительным, столбец Warm TTFT Avg (s) показывает лучшую производительность после загрузки KV-кэша. Контекст был полностью загружен при первом взаимодействии намеренно.
Для проверки возможностей контекста моделям давался промпт из одного предложения для суммирования логов, за которым следовали логовые данные объёмом от 2 тыс. до 400 тыс. токенов. Разработчик сообщил о некоторых расхождениях, но в целом удовлетворительной производительности.
Текущий статус и следующие шаги
Три модели не прошли тестирование и проходят тесты с выгрузкой KV-кэша: Qwen3.5-4B-bf16, Qwen3.5-27B-Q4_K_M и Qwen3.5-35B-A3B-Q4_K_M. Разработчику пришлось перезапустить эти тесты после проблемы со скриптом, которая потратила 24 часа времени выполнения.
После завершения тестов с выгрузкой VRAM разработчик планирует сравнить результаты с базовыми моделями и сохранил выводы для анализа. Разработчик выразил особое удивление производительностью плотных моделей 9B и 27B.
Разработчик ищет мнение сообщества о том, с какими моделями сравнивать и какую методологию оценки использовать для градации.
📖 Read the full source: r/openclaw
👀 Смотрите также

Трафик сабреддита r/ClaudeAI резко вырос с 500 тысяч до 1,9 миллиона посетителей в неделю.
Подреддит r/ClaudeAI вырос примерно с 250 тысяч посетителей в неделю в ноябре 2025 года до 1,9 миллиона в марте 2026 года, при этом количество подписчиков осталось на уровне около 85 тысяч пользователей.
Акции Alphabet теряют $700 млрд на фоне роста счетов за ИИ
Акции Alphabet упали на 15% от майского пика, потеряв около 700 млрд долларов рыночной стоимости. Инвесторы обеспокоены ростом затрат на ИИ и задержками Gemini, а соучредитель Сергей Брин возвращается к управлению.
Мнение UX-дизайнера: Дизайн Claude не может заменить опытных дизайнеров
UX-дизайнер утверждает, что Claude Design переоценен и полезен только для не-дизайнеров, чтобы прототипировать идеи, начинающих стартапов и портфолио для новичков.

Утечка кода Claude раскрывает систему KAIROS и пробел в верификации ИИ-агентов
Утечка карты исходного кода Claude Code показала 512 тысяч строк TypeScript, 44 флажка функций и KAIROS — фоновый агент, который консолидирует память в периоды простоя. Независимый разработчик создал аналогичный демон для объединения сессий в многодневные кампании, но обнаружил, что успешная компиляция не гарантирует работоспособность кода.