Результаты тестирования моделей Qwen3.5 с контекстом от 2K до 400K на RTX 4090

Тестирование производительности Qwen3.5 на RTX 4090
Разработчик поделился результатами бенчмарков для моделей Qwen3.5, запущенных на видеокарте RTX 4090, протестировав размеры контекста от 2 048 до 400 000 токенов. Изначально тесты планировались для контекста в 262 тыс. токенов, но были расширены до 400 тыс. с использованием yarn и других методов.
Протестированные модели
Были протестированы следующие варианты моделей Qwen3.5:
- Qwen3.5-0.8B-Q4_K_M
- Qwen3.5-0.8B-bf16
- Qwen3.5-2B-Q4_K_M
- Qwen3.5-2B-bf16
- Qwen3.5-4B-Q4_K_M
- Qwen3.5-4B-bf16
- Qwen3.5-9B-Q4_K_M
- Qwen3.5-9B-bf16
- Qwen3.5-27B-Q4_K_M
- Qwen3.5-35B-A3B-Q4_K_M
Протестированные размеры контекста
Модели оценивались при следующих конкретных длинах контекста: 2048, 4096, 8192, 32768, 65536, 98304, 131072, 196608, 262144, 327680, 360448, 393216 и 400000 токенов.
Методология тестирования
Скрипт бенчмарка был настроен для достижения максимально возможной скорости в токенах/секунду с использованием настроек NGL с 8-битным и 4-битным KV-кэшем. Разработчик отметил, что хотя начальное время до первого токена (TTFT) кажется длительным, столбец Warm TTFT Avg (s) показывает лучшую производительность после загрузки KV-кэша. Контекст был полностью загружен при первом взаимодействии намеренно.
Для проверки возможностей контекста моделям давался промпт из одного предложения для суммирования логов, за которым следовали логовые данные объёмом от 2 тыс. до 400 тыс. токенов. Разработчик сообщил о некоторых расхождениях, но в целом удовлетворительной производительности.
Текущий статус и следующие шаги
Три модели не прошли тестирование и проходят тесты с выгрузкой KV-кэша: Qwen3.5-4B-bf16, Qwen3.5-27B-Q4_K_M и Qwen3.5-35B-A3B-Q4_K_M. Разработчику пришлось перезапустить эти тесты после проблемы со скриптом, которая потратила 24 часа времени выполнения.
После завершения тестов с выгрузкой VRAM разработчик планирует сравнить результаты с базовыми моделями и сохранил выводы для анализа. Разработчик выразил особое удивление производительностью плотных моделей 9B и 27B.
Разработчик ищет мнение сообщества о том, с какими моделями сравнивать и какую методологию оценки использовать для градации.
📖 Read the full source: r/openclaw
👀 Смотрите также

Claude AI представляет обновления плагина Cowork с корпоративной настройкой и новыми коннекторами.
Claude AI выпустил обновления плагина Cowork, которые позволяют корпоративным администраторам создавать частные маркетплейсы плагинов и добавлять коннекторы для Google Workspace, Docusign, Apollo и других инструментов. Новый исследовательский превью позволяет Claude работать с Excel и PowerPoint для сквозного анализа и создания презентаций.

Нейроморфная машина Изинга на FPGA решает сложные комбинаторные задачи
Нейроморфная машина Изинга, реализованная на FPGA, использует физику квантового туннелирования и архитектуру, вдохновленную мозгом, для решения задач комбинаторной оптимизации, таких как сворачивание белков.

Anthropic отменяет политику в отношении сторонних SDK и claude-p, снижая эффективную стоимость инференса для максимальных подписчиков в 25–40 раз
Anthropic отменила запрет на использование сторонними агентами учетных данных подписки, но переместила claude-p и Agent SDK в отдельный, непереносимый пул кредитов, выставляемый по тарифам API, что снизило эффективную стоимость вывода для подписчиков Max в 25–40 раз.

YouTube 自动标记 AI 视频:2026 年简化标签与自动检测
YouTube обновляет маркировку AI: более заметное размещение, автоматическое обнаружение фотореалистичного AI-контента и постоянные метки для видео, созданных с помощью собственных AI-инструментов YouTube или метаданных C2PA.