Сравнение бенчмарков Qwen3.6 Plus с западными моделями SOTA

✍️ OpenClawRadar📅 Опубликовано: 5 апреля 2026 г.🔗 Source
Сравнение бенчмарков Qwen3.6 Plus с западными моделями SOTA
Ad

Публикация на Reddit в сообществе r/LocalLLaMA сравнивает Qwen3.6 Plus с несколькими западными передовыми моделями по различным тестам. Сравнение включает конкретные показатели производительности для каждой модели.

Результаты тестирования

В источнике приводятся следующие точные оценки:

  • Qwen3.6-Plus: SWE-bench Verified 78.8, GPQA / GPQA Diamond 90.4, HLE (без инструментов) 28.8, MMMU-Pro 78.8
  • GPT‑5.4 (xhigh): SWE-bench Verified 78.2, GPQA / GPQA Diamond 93.0, HLE (без инструментов) 39.8, MMMU-Pro 81.2
  • Claude Opus 4.6 (thinking heavy): SWE-bench Verified 80.8, GPQA / GPQA Diamond 91.3, HLE (без инструментов) 34.44, MMMU-Pro 77.3
  • Gemini 3.1 Pro Preview: SWE-bench Verified 80.6, GPQA / GPQA Diamond 94.3, HLE (без инструментов) 44.7, MMMU-Pro 80.5

В публикации также представлена визуальная сравнительная диаграмма, доступная по ссылке: https://preview.redd.it/6kq4tt07yrsg1.png?width=714&format=png&auto=webp&s=ad8b207fb13729ae84f5b74cec5fd84a81dcface

Ad

Оценка пользователя

Автор оригинальной публикации отмечает, что Qwen3.6 Plus является «конкурентоспособным, но не лидером», и заявляет: «Будет моей новой моделью, учитывая её низкую стоимость, но то, насколько она действительно хороша в реальных условиях, зависит не только от тестов». Он также отмечает, что «Opus превосходит всех остальных, несмотря на то, что занимает 3-е или 4-е место в искусственных анализах».

📖 Read the full source: r/LocalLLaMA

Ad

👀 Смотрите также

Анализ принудительного системного промпта Claude Code на ~12K токенов выявил приоритет правил над конфигурацией пользователя
Новости

Анализ принудительного системного промпта Claude Code на ~12K токенов выявил приоритет правил над конфигурацией пользователя

Анализ внедренного системного промпта Claude Code объемом ~12K токенов показывает приоритетные правила запрета текстов песен, делегирования субагентов и краткости, которые отменяют пользовательские CLAUDE.md и файлы памяти.

OpenClawRadar
Опыт разработчика с ИИ Claude: от партнера по размышлениям до когнитивного аутсорсинга
Новости

Опыт разработчика с ИИ Claude: от партнера по размышлениям до когнитивного аутсорсинга

Разработчик делится 8-месячным опытом ежедневного использования Claude AI, отмечая переход от использования ИИ для улучшения собственных мыслей к полному аутсорсингу начального мышления. В посте описываются два различных когнитивных подхода: ИИ как партнёр по мышлению против ИИ как генератора первого наброска.

OpenClawRadar
Docker-контейнеры: Аргументы против cron-заданий
Новости

Docker-контейнеры: Аргументы против cron-заданий

Обсуждение на r/openclaw поднимает спорную тему использования cron-задач в контейнерах Docker. Хотя легкая автоматизация может быть немедленным преимуществом, сообщество советует избегать этого.

OpenClawRadar
Claude Code v2.1.160: Подсказки безопасности для конфигурации оболочки, защита файлов acceptEdits и десятки исправлений ошибок
Новости

Claude Code v2.1.160: Подсказки безопасности для конфигурации оболочки, защита файлов acceptEdits и десятки исправлений ошибок

Anthropic выпустил Claude Code v2.1.160 с запросами подтверждения перед записью в startup-файлы оболочки и конфигурации инструментов сборки в режиме acceptEdits, улучшенной поддержкой буфера обмена Windows и исправлением потери истории сессий.

OpenClawRadar