Бенчмарки производительности Qwen3.5-27B-FP8 с агентами OpenClaw.

✍️ OpenClawRadar📅 Опубликовано: 28 февраля 2026 г.🔗 Source
Бенчмарки производительности Qwen3.5-27B-FP8 с агентами OpenClaw.
Ad

Бенчмарки производительности из сообщества тестировщиков

Тестирование сообществом проводилось на одной модифицированной видеокарте RTX 4090 с 48 ГБ видеопамяти. Официальные модели Qwen3.5-35B-A3B-FP8 и Qwen3.5-27B-FP8 тестировались с длиной контекста 256K.

Рекомендации по фреймворкам

Рекомендуется использовать SGLang как единственный фреймворк, полностью поддерживающий кэширование префиксов, что критически важно для гибридной архитектуры внимания Qwen3.5.

  • Для контекста в 100K: Предзаполнение с холодного старта занимает около 10 секунд
  • С кэшированием: Предзаполнение сокращается до 200 мс
  • Результат: Очень низкая задержка первого токена и чрезвычайно быстрый вывод

Метрики производительности моделей

  • Qwen3.5-35B-A3B-FP8: Начинала с 120 токенов/сек, снижалась до 80 токенов/сек
  • Qwen3.5-27B-FP8: Начинала с 20 токенов/сек, незначительно снижалась до 18 токенов/сек
Ad

Масштабирование агентов OpenClaw

OpenClaw может запускать команды агентов с шестью агентами одновременно, и скорость масштабируется до 120 токенов в секунду. Тестировщик отметил удивление таким поведением масштабирования.

Упомянутый недостаток заключается в том, что производительность в однопоточном режиме при такой конфигурации низкая.

Заметки по оптимизации MTP

Включение MTP (Многотокенное предсказание) для модели 27B-FP8 может значительно повысить скорость генерации для одного запроса:

  • На одной видеокарте NVIDIA H100: Поддерживает 100 токенов/сек с окном контекста в 20K
  • Скорость предзаполнения для 64K токенов: Менее 1 секунды

Важное предостережение: MTP конфликтует с кэшированием префиксов и требует много видеопамяти. Пользователям с RTX 4090 следует начинать с более низкой настройки num-steps.

📖 Read the full source: r/openclaw

Ad

👀 Смотрите также

Автоматизация социальных сетей с OpenClaw: возможности и обсуждения
Новости

Автоматизация социальных сетей с OpenClaw: возможности и обсуждения

Обсуждение на Reddit поднимает вопрос об автоматизации задач на социальных платформах, таких как Instagram и TikTok, с использованием OpenClaw.

OpenClawRadar
Grokipedia застопорилась: с апреля не принято ни одной правки, ИИ-Википедия Маска тихо умирает
Новости

Grokipedia застопорилась: с апреля не принято ни одной правки, ИИ-Википедия Маска тихо умирает

Grokipedia от xAI — созданный ИИ конкурент Википедии — не принял и не отклонил ни одной из 225 496 предложенных правок за более чем три месяца. Мертв ли он?

OpenClawRadar
Пользователь OpenClaw сообщает о 143 млн токенов, обработанных за $94 через OpenRouter.
Новости

Пользователь OpenClaw сообщает о 143 млн токенов, обработанных за $94 через OpenRouter.

Пользователь Reddit, использующий мультиагентные конвейеры OpenClaw, обработал 143 миллиона токенов за $94,16, достигнув стоимости примерно $0,66 за миллион токенов благодаря маршрутизации через OpenRouter и реализации специфических оптимизаций конфигурации.

OpenClawRadar
Тонко настроенные модели Qwen3 Small превосходят передовые LLM в определенных задачах при более низкой стоимости.
Новости

Тонко настроенные модели Qwen3 Small превосходят передовые LLM в определенных задачах при более низкой стоимости.

Дистиллированные модели Qwen3 (от 0,6 до 8 млрд параметров) превзошли или сравнялись с передовыми API-моделями, такими как GPT-5, Gemini и Claude, в 6 из 9 задач, включая вызов функций и Text2SQL, при стоимости всего $3 за миллион запросов против $378 за сопоставимую производительность.

OpenClawRadar