Сравнение бенчмарков Qwen3.6 Plus с западными моделями SOTA

Публикация на Reddit в сообществе r/LocalLLaMA сравнивает Qwen3.6 Plus с несколькими западными передовыми моделями по различным тестам. Сравнение включает конкретные показатели производительности для каждой модели.
Результаты тестирования
В источнике приводятся следующие точные оценки:
- Qwen3.6-Plus: SWE-bench Verified 78.8, GPQA / GPQA Diamond 90.4, HLE (без инструментов) 28.8, MMMU-Pro 78.8
- GPT‑5.4 (xhigh): SWE-bench Verified 78.2, GPQA / GPQA Diamond 93.0, HLE (без инструментов) 39.8, MMMU-Pro 81.2
- Claude Opus 4.6 (thinking heavy): SWE-bench Verified 80.8, GPQA / GPQA Diamond 91.3, HLE (без инструментов) 34.44, MMMU-Pro 77.3
- Gemini 3.1 Pro Preview: SWE-bench Verified 80.6, GPQA / GPQA Diamond 94.3, HLE (без инструментов) 44.7, MMMU-Pro 80.5
В публикации также представлена визуальная сравнительная диаграмма, доступная по ссылке: https://preview.redd.it/6kq4tt07yrsg1.png?width=714&format=png&auto=webp&s=ad8b207fb13729ae84f5b74cec5fd84a81dcface
Оценка пользователя
Автор оригинальной публикации отмечает, что Qwen3.6 Plus является «конкурентоспособным, но не лидером», и заявляет: «Будет моей новой моделью, учитывая её низкую стоимость, но то, насколько она действительно хороша в реальных условиях, зависит не только от тестов». Он также отмечает, что «Opus превосходит всех остальных, несмотря на то, что занимает 3-е или 4-е место в искусственных анализах».
📖 Read the full source: r/LocalLLaMA
👀 Смотрите также

OpenAI及其竞争对手发布智能体插件:一种适用于AI代理的包格式
OpenAI, Amazon, Microsoft, Cursor и Vercel выпустили Agent Plugins 1.0 — открытый стандарт для упаковки расширений для ИИ-агентов. Создайте один раз, работайте в ChatGPT, Codex, Copilot, Cursor и других.

Tencent проводит бесплатное мероприятие по установке OpenClaw в Шэньчжэне на фоне высокого спроса.
Tencent организовала 20 сотрудников у своего офисного здания в Шэньчжэне для бесплатной установки OpenClaw 6 марта, реагируя на сообщения о том, что люди платят более 70 долларов за услуги установки на дому. Мероприятие использовало платформу Tencent Cloud Lighthouse, большинство участников были белыми воротничками, сталкивающимися с конкуренцией на рабочем месте и давлением внедрения ИИ.

GitHub Copilot Code Review начнёт тратить минуты Actions с 1 июня 2026 года
С 1 июня 2026 года проверки кода GitHub Copilot в частных репозиториях начнут расходовать минуты GitHub Actions в дополнение к AI-кредитам. Публичные репозитории останутся бесплатными.

Merlin Research выпускает модель Qwen3.5-4B-Safety-Thinking для структурированного рассуждения.
Исследовательская группа Merlin Research представила Qwen3.5-4B-Safety-Thinking — модель рассуждений с 4 миллиардами параметров, ориентированную на безопасность и построенную на основе Qwen3.5. Модель предназначена для структурированного «мышления» и обеспечения безопасности в реальных сценариях, включая агентные системы.