Сравнение производительности моделей Qwen 3.5 с основными моделями искусственного интеллекта

Был опубликован сайт для сравнения бенчмарков, который предоставляет данные о производительности различных больших языковых моделей в прямом сравнении. Сайт включает проверенные оценки и сравнительные инфографики для ряда моделей, с акцентом на серию Qwen 3.5 от Alibaba.
Модели, включённые в сравнение
В источнике перечислены следующие модели, которые являются частью полного сравнения:
- GPT-5.2
- Claude 4.5 Opus
- Gemini-3 Pro
- Qwen3-Max-Thinking
- K2.5-1T-A32B
- Qwen3.5-397B
- GPT-5-mini
- GPT-OSS-120B
- Qwen3-235B
- Qwen3.5-122B
- Qwen3.5-27B
- Qwen3.5-35B
Что предоставляет источник
Исходный материал конкретно указывает, что сравнение включает "все проверенные оценки и сравнительные инфографики". Это предполагает, что сайт агрегирует метрики производительности из стандартизированных ИИ-бенчмарков, которые обычно измеряют возможности в таких областях, как логическое мышление, программирование и общие знания. Предоставленная ссылка ведёт на специальный сайт для сравнения по адресу https://compareqwen35.tiiny.site.
Для контекста, сравнения по бенчмаркам являются стандартным методом в сообществе ИИ для объективной оценки производительности моделей. Серия Qwen — это модели с открытым исходным кодом, разработанные Alibaba, и их сравнение с проприетарными моделями от OpenAI (GPT), Anthropic (Claude) и Google (Gemini) предоставляет практические данные для разработчиков, выбирающих, какую модель использовать или дообучать для конкретных задач. Включение размеров параметров (например, 122B, 397B) указывает на то, что сравнение охватывает модели различного масштаба, что важно для оценки производительности относительно вычислительных затрат.
📖 Read the full source: r/LocalLLaMA
👀 Смотрите также

ИИ-брокеномика: Хаос с запретом Anthropic на экспорт мифов/басен
Модель Mythos от Anthropic, названную «слишком опасной для выпуска», взломали за несколько дней, что привело к введению экспортных ограничений США, запрещающих доступ негражданам США. Защитные механизмы Fable не сработали, когда исследователи Amazon обошли их, что вызвало откат по соображениям национальной безопасности.

Улучшения и исправления Claude-Code v2.1.45
Claude-Code v2.1.45 внедряет поддержку Claude Sonnet 4.6 и различные исправления для стабильности системы.

Ubuntu Linux планирует интеграцию функций ИИ в течение следующего года, начиная с локального вывода
Canonical объявляет о многолетней AI-стратегии для Ubuntu, сосредоточенной на локальном выведении, агентных рабочих процессах и контекстно-зависимых возможностях ОС. Функции будут внедряться на протяжении 2026 года.

Qwen 35B-A3B как постоянно активный агент на 16 ГБ M4 Mac: отказ ввода-вывода на диск до возникновения проблем с ОЗУ
Запуск Qwen 35B-A3B с llama.cpp на 16GB M4 Mac работает для пакетного вывода, но постоянный агентный цикл вместе с Claude Code и Codex CLI вызывает конкуренцию за SSD, что приводит к нестабильности системы и пропущенным задачам cron, несмотря на достаточный объем RAM.