Результаты тестирования: 15 языковых моделей проверены на 38 реальных рабочих задачах

✍️ OpenClawRadar📅 Опубликовано: 10 марта 2026 г.🔗 Source
Результаты тестирования: 15 языковых моделей проверены на 38 реальных рабочих задачах
Ad

Разработчик создал тестовую систему для определения, каким языковым моделям направлять задачи, протестировав 15 моделей на 38 задачах из своего реального рабочего процесса. Задачи включали преобразование CSV, подсчёт букв, модульную арифметику, соответствие формату и многошаговые инструкции. Все задачи оценивались программно с использованием регулярных выражений и точного совпадения — без привлечения языковой модели в качестве судьи.

Результаты тестирования

Тестирование включало 570 API-вызовов общей стоимостью $2,29. Ключевые выводы:

  • Claude 3.5 Opus: 100% результат, $0,69 за запуск, 14,2 секунды
  • Claude 3.5 Sonnet: 100% результат, $0,20 за запуск, 5,1 секунды
  • MiniMax M2.5: 98,60% результат, $0,02 за запуск, 2,3 секунды
  • Kimi K2.5: 98,60% результат, $0,05 за запуск, 3,8 секунды
  • GPT-oss-20b (локальная): 98,30% результат, $0 за запуск, 4,1 секунды
  • Gemini 2.5 Flash: 97,10% результат, $0,00 за запуск, 1,1 секунды
  • Claude 3.5 Haiku: 96,90% результат, $0,02 за запуск, 1,8 секунды
Ad

Анализ стоимости и производительности

Sonnet и Opus оба набрали 100%, но Opus стоит в 3,5 раза дороже за вызов. Для повседневных задач разработчика Sonnet справляется со всем тем же, что и Opus. Gemini Flash стоимостью $0,003 за запуск против Opus за $0,69 представляет собой 265-кратную разницу в стоимости при разнице в производительности всего 2,9 пункта.

Неожиданные результаты

MiniMax M2.5 и Kimi K2.5 оба достигли 98,6% со 100% соответствием формату — разработчик не использовал ни одну из этих моделей до проведения тестирования. Локально запущенный GPT-oss-20b набрал 98,3% за $0, превзойдя Haiku и DeepSeek R1.

Процесс контроля качества

Процесс контроля качества выявил ошибки в системе оценки. Первоначальные результаты показывали, что Haiku превосходит Sonnet, что оказалось ошибкой системы оценки, выдававшей результаты выше 100%. Было проведено пять проверок контроля качества, каждая с разной моделью, и каждая находила ошибки, пропущенные предыдущими.

Разработчик меняет свою основную модель на Sonnet на основе этих результатов, но планирует чаще переключаться между моделями из-за различий в производительности.

📖 Read the full source: r/ClaudeAI

Ad

👀 Смотрите также

RUNE Protocol: Сохраняйте память сессий ИИ на разных платформах
Инструменты

RUNE Protocol: Сохраняйте память сессий ИИ на разных платформах

RUNE (Relational User Notation for Entities) — это открытый протокол, который сохраняет ваши отношения с ИИ в зашифрованный файл .rune, решая проблему «холодного старта», когда ассистенты на базе ИИ забывают вас между сессиями. Созданный с помощью Claude Opus 4.6, он работает на платформах Claude и GPT.

OpenClawRadar
Инструмент с открытым исходным кодом Vigil решает проблему идентификации агентов в экосистеме OpenClaw.
Инструменты

Инструмент с открытым исходным кодом Vigil решает проблему идентификации агентов в экосистеме OpenClaw.

Пользователь OpenClaw, создающий веб-сервис, обнаружил трафик агентов, неотличимый от трафика реальных пользователей, что побудило к разработке Vigil — открытого уровня идентификации на основе W3C DID, предоставляющего агентам криптографические учетные данные и историю поведения.

OpenClawRadar
GitAgent: Открытый стандарт для портативных ИИ-агентов в Git-репозиториях
Инструменты

GitAgent: Открытый стандарт для портативных ИИ-агентов в Git-репозиториях

GitAgent — это открытая спецификация, определяющая ИИ-агентов через три основных файла в git-репозитории: agent.yaml для конфигурации, SOUL.md для личности/инструкций и SKILL.md для возможностей. CLI позволяет запускать любой репозиторий агента напрямую с помощью команд, например, npx @open-gitagent/gitagent run -r https://github.com/user/agent -a claude.

OpenClawRadar
Джемма 4 E2B протестирована в роли координатора мультиагентов в TypeScript-фреймворке.
Инструменты

Джемма 4 E2B протестирована в роли координатора мультиагентов в TypeScript-фреймворке.

Разработчик протестировал Gemma 4 E2B в роли координатора в мультиагентной системе с использованием фреймворка open-multi-agent на TypeScript. Модель успешно декомпозировала задачи в JSON, назначала агентов, вызывала инструменты, такие как bash и файловые операции, и синтезировала результаты.

OpenClawRadar