Результаты слепого оценивания Gemma 4 и Qwen 3.5 с Claude Opus в роли судьи

✍️ OpenClawRadar📅 Опубликовано: 15 апреля 2026 г.🔗 Source
Результаты слепого оценивания Gemma 4 и Qwen 3.5 с Claude Opus в роли судьи
Ad

Пользователь Reddit провёл трёхстороннее прямое сравнение моделей Gemma 4 31B, Gemma 4 26B-A4B и Qwen 3.5 27B, используя Claude Opus 4.6 в качестве оценивающего судьи.

Настройка оценивания

Тест использовал 30 вопросов по пяти категориям: код, логическое мышление, анализ, коммуникация и мета-соответствие (по 6 вопросов на категорию). Все модели отвечали на одни и те же вопросы вслепую, без различий в системных промптах и с одинаковыми настройками температуры. Claude Opus 4.6 оценивал каждый ответ независимо по шкале от 0 до 10, используя структурированную рубрику, с абсолютной оценкой за каждый ответ, а не попарным сравнением. Для обеспечения согласованности использовался один судья (Opus 4.6), хотя это создаёт риск позиционного смещения. Общая стоимость составила $4,50.

Результаты

Количество побед (наивысший балл за вопрос):

  • Qwen 3.5 27B: 14 побед (46,7%)
  • Gemma 4 31B: 12 побед (40,0%)
  • Gemma 4 26B-A4B: 4 победы (13,3%)

Средние баллы:

  • Gemma 4 31B: 8,82 (30 оценок)
  • Gemma 4 26B-A4B: 8,82 (28 оценок)
  • Qwen 3.5 27B: 8,17 (30 оценок)

Qwen выиграл больше матчей, но имел более низкий средний балл из-за трёх оценок 0,0 по вопросам CODE-001, REASON-004 и ANALYSIS-017, которые, по-видимому, были связаны с ошибками формата или отказами отвечать, а не с действительно плохими ответами. Без этих трёх оценок средний балл Qwen подскакивает примерно до 9,08, что было бы наивысшим показателем среди трёх моделей.

Ad

Разбивка по категориям

  • Код: Ничья между Gemma 4 31B и Qwen (по 3 победы у каждой)
  • Логическое мышление: Qwen доминировал (5 из 6 побед)
  • Анализ: Qwen доминировал (4 из 6 побед)
  • Коммуникация: Gemma 4 31B доминировал (5 из 6 побед)
  • Мета-соответствие: Равное распределение между тремя моделями (2-2-2 победы)

Наблюдения

  • Gemma 4 26B-A4B (вариант MoE) полностью выдал ошибку на 2 вопроса. Когда она работала, её баллы почти точно совпадали с плотной моделью 31B, имея такое же среднее значение 8,82.
  • У Gemma 4 31B были абсурдно долгие времена ответа, включая несколько генераций по 5 минут, которые, по-видимому, включали интенсивную внутреннюю цепочку рассуждений, но это не коррелировало с более высокими баллами.
  • Qwen 3.5 27B генерирует в среднем в 3-5 раз больше токенов на ответ, создавая «налог на многословие», хотя судья, казалось, не наказывал и не поощрял это последовательно.

Методологические оговорки

  • 30 вопросов — это небольшая выборка, не позволяющая делать заявления о статистической значимости
  • Один судья (Opus 4.6) означает, что любое систематическое смещение влияет на каждый балл
  • Использование LLM в качестве судьи имеет известные проблемы: смещение в пользу многословия, предпочтение собственного стиля, позиционное смещение
  • Вопросы были оригинальными, а не из стандартных тестов, отражая предвзятость оценщика

📖 Read the full source: r/LocalLLaMA

Ad

👀 Смотрите также

Claude Code v2.1.118 добавляет визуальный режим Vim, пользовательские темы и улучшения MCP.
Новости

Claude Code v2.1.118 добавляет визуальный режим Vim, пользовательские темы и улучшения MCP.

Claude Code v2.1.118 представляет режим Vim visual с операторами выбора, управление пользовательскими темами через команду /theme и несколько исправлений для аутентификации MCP OAuth и разрешения зависимостей плагинов.

OpenClawRadar
Мельбурнский психиатр отказывает новым пациентам, не согласным на ведение записей с помощью ИИ
Новости

Мельбурнский психиатр отказывает новым пациентам, не согласным на ведение записей с помощью ИИ

Мельбурнский психиатр теперь требует от новых пациентов согласия на транскрибирование сеансов с помощью ИИ, иначе их направляют в другое место, что вызывает опасения по поводу безопасности данных и точности.

OpenClawRadar
Обновление OpenClaw 2026.3.2 отключает инструменты агента по умолчанию.
Новости

Обновление OpenClaw 2026.3.2 отключает инструменты агента по умолчанию.

OpenClaw 2026.3.2 отключает все разрешения для инструментов агентов по умолчанию, что не позволяет работать таким инструментам, как exec и web_fetch. Для исправления требуется добавить конфигурацию в файл openclaw.json.

OpenClawRadar
Claude Code v2.1.153: Skip LFS, исправления MCP и автозаполнение агента
Новости

Claude Code v2.1.153: Skip LFS, исправления MCP и автозаполнение агента

Claude Code v2.1.153 добавляет опцию skipLfs для обхода Git LFS, исправляет циклы переподключения MCP-сервера и улучшает автозаполнение слэш-команд в режиме агента.

OpenClawRadar