Бенчмарки производительности Qwen3.5-27B-FP8 с агентами OpenClaw.

Бенчмарки производительности из сообщества тестировщиков
Тестирование сообществом проводилось на одной модифицированной видеокарте RTX 4090 с 48 ГБ видеопамяти. Официальные модели Qwen3.5-35B-A3B-FP8 и Qwen3.5-27B-FP8 тестировались с длиной контекста 256K.
Рекомендации по фреймворкам
Рекомендуется использовать SGLang как единственный фреймворк, полностью поддерживающий кэширование префиксов, что критически важно для гибридной архитектуры внимания Qwen3.5.
- Для контекста в 100K: Предзаполнение с холодного старта занимает около 10 секунд
- С кэшированием: Предзаполнение сокращается до 200 мс
- Результат: Очень низкая задержка первого токена и чрезвычайно быстрый вывод
Метрики производительности моделей
- Qwen3.5-35B-A3B-FP8: Начинала с 120 токенов/сек, снижалась до 80 токенов/сек
- Qwen3.5-27B-FP8: Начинала с 20 токенов/сек, незначительно снижалась до 18 токенов/сек
Масштабирование агентов OpenClaw
OpenClaw может запускать команды агентов с шестью агентами одновременно, и скорость масштабируется до 120 токенов в секунду. Тестировщик отметил удивление таким поведением масштабирования.
Упомянутый недостаток заключается в том, что производительность в однопоточном режиме при такой конфигурации низкая.
Заметки по оптимизации MTP
Включение MTP (Многотокенное предсказание) для модели 27B-FP8 может значительно повысить скорость генерации для одного запроса:
- На одной видеокарте NVIDIA H100: Поддерживает 100 токенов/сек с окном контекста в 20K
- Скорость предзаполнения для 64K токенов: Менее 1 секунды
Важное предостережение: MTP конфликтует с кэшированием префиксов и требует много видеопамяти. Пользователям с RTX 4090 следует начинать с более низкой настройки num-steps.
📖 Read the full source: r/openclaw
👀 Смотрите также

Автоматизация социальных сетей с OpenClaw: возможности и обсуждения
Обсуждение на Reddit поднимает вопрос об автоматизации задач на социальных платформах, таких как Instagram и TikTok, с использованием OpenClaw.

Grokipedia застопорилась: с апреля не принято ни одной правки, ИИ-Википедия Маска тихо умирает
Grokipedia от xAI — созданный ИИ конкурент Википедии — не принял и не отклонил ни одной из 225 496 предложенных правок за более чем три месяца. Мертв ли он?

Пользователь OpenClaw сообщает о 143 млн токенов, обработанных за $94 через OpenRouter.
Пользователь Reddit, использующий мультиагентные конвейеры OpenClaw, обработал 143 миллиона токенов за $94,16, достигнув стоимости примерно $0,66 за миллион токенов благодаря маршрутизации через OpenRouter и реализации специфических оптимизаций конфигурации.

Тонко настроенные модели Qwen3 Small превосходят передовые LLM в определенных задачах при более низкой стоимости.
Дистиллированные модели Qwen3 (от 0,6 до 8 млрд параметров) превзошли или сравнялись с передовыми API-моделями, такими как GPT-5, Gemini и Claude, в 6 из 9 задач, включая вызов функций и Text2SQL, при стоимости всего $3 за миллион запросов против $378 за сопоставимую производительность.