Бенчмарки производительности Qwen3.5-27B-FP8 с агентами OpenClaw.

Бенчмарки производительности из сообщества тестировщиков
Тестирование сообществом проводилось на одной модифицированной видеокарте RTX 4090 с 48 ГБ видеопамяти. Официальные модели Qwen3.5-35B-A3B-FP8 и Qwen3.5-27B-FP8 тестировались с длиной контекста 256K.
Рекомендации по фреймворкам
Рекомендуется использовать SGLang как единственный фреймворк, полностью поддерживающий кэширование префиксов, что критически важно для гибридной архитектуры внимания Qwen3.5.
- Для контекста в 100K: Предзаполнение с холодного старта занимает около 10 секунд
- С кэшированием: Предзаполнение сокращается до 200 мс
- Результат: Очень низкая задержка первого токена и чрезвычайно быстрый вывод
Метрики производительности моделей
- Qwen3.5-35B-A3B-FP8: Начинала с 120 токенов/сек, снижалась до 80 токенов/сек
- Qwen3.5-27B-FP8: Начинала с 20 токенов/сек, незначительно снижалась до 18 токенов/сек
Масштабирование агентов OpenClaw
OpenClaw может запускать команды агентов с шестью агентами одновременно, и скорость масштабируется до 120 токенов в секунду. Тестировщик отметил удивление таким поведением масштабирования.
Упомянутый недостаток заключается в том, что производительность в однопоточном режиме при такой конфигурации низкая.
Заметки по оптимизации MTP
Включение MTP (Многотокенное предсказание) для модели 27B-FP8 может значительно повысить скорость генерации для одного запроса:
- На одной видеокарте NVIDIA H100: Поддерживает 100 токенов/сек с окном контекста в 20K
- Скорость предзаполнения для 64K токенов: Менее 1 секунды
Важное предостережение: MTP конфликтует с кэшированием префиксов и требует много видеопамяти. Пользователям с RTX 4090 следует начинать с более низкой настройки num-steps.
📖 Read the full source: r/openclaw
👀 Смотрите также

Анализ кампании астротурфинга OpenClaw и накачки токена $CLAWD
Расследование на Reddit показало, что вирусный рост OpenClaw в конце января был обусловлен рекурсивной кампанией астротурфинга с использованием примерно 400 бот-инстансов, которые создали ажиотаж для накачки токена $CLAWD до рыночной капитализации в $16 млн, после чего его стоимость обвалилась на 90%.

Модель MiniMax M2.7 демонстрирует высокую производительность в роли ИИ-агента для программирования.
Разработчик протестировал MiniMax M2.7 в качестве основного ИИ-агента для программирования и обнаружил, что он превзошёл GPT 5.4 и Gemini 3.1 Pro по скорости и задачам, связанным с инструментами, с результатами бенчмарков 56.22% на SWE-Pro и 57.0% на Terminal Bench 2.

CC v2.1.122: Удаление системных подсказок, обновление отладки и повышение уверенности в расписании
Claude Code CC v2.1.122 удаляет отдельный подсказку для четвертой фазы в режиме плана, улучшает резервный контекст отладки демона и повышает порог уверенности для предложений /schedule с 70%+ до 85%+.

Amazon Connect Talent: ИИ-агенты автоматизируют массовые собеседования
Amazon запускает Connect Talent — ИИ-агента, который проводит автоматизированные собеседования для массового найма. Программное обеспечение берет на себя скрининг, интервью и ведение заметок без вмешательства человека, являясь частью более широкого движения к автономным ИИ-агентам.