Бенчмаркинг последних ИИ-моделей: Восхождение экстремальных моделей

✍️ OpenClawRadar📅 Опубликовано: 13 февраля 2026 г.🔗 Source
Бенчмаркинг последних ИИ-моделей: Восхождение экстремальных моделей
Ad

Недавний бенчмаркинг 40 новых AI-моделей выявляет значительные изменения в балансе цены и производительности. Сосредоточив внимание на Kimi k2.5 и Claude Opus 4.6, анализ демонстрирует разделение на два экстремума: 'God Mode' и 'Flash Mode', что делает модели среднего уровня неэффективными.

Ad

Ключевые детали

  • Ситуация с Kimi k2.5: Попытки провести бенчмаркинг Kimi k2.5 оказались безуспешными из-за постоянных ошибок 'No Content', вероятно, из-за перегрузки. Тем не менее, Kimi-k2-Thinking показал удовлетворительные результаты для сложных задач рассуждения с ~15 TPS.
  • доминирование скорости: Для приложений с чувствительностью к задержке модель Liquid LFM 2.5 оказалась самой быстрой, достигая ~359 токенов в секунду, за ней следует Ministral 3B с ~293 токенами в секунду.
  • Экономическая эффективность: Ministral 3B выделяется как наиболее экономически эффективное решение, costing $0.10/1M входных токенов. Он ~17x дешевле и ~40% быстрее, чем GPT-5.2 Codex, что делает его выгодным вариантом по сравнению с более дорогими предложениями.

Рекомендуется избегать моделей среднего уровня стоимостью от $0.50 до $1.00, так как они не предлагают конкурентоспособной производительности. В зависимости от ваших потребностей, выбирайте модели более высокого ценового сегмента, такие как Opus/GPT-5 для интеллекта, или выбирайте экономичную скорость с Liquid/Mistral.

📖 Читать полный источник: r/LocalLLaMA

Ad

👀 Смотрите также

Claude Code v2.1.162: информация об ожидании сессии, исправление тайм-аута MCP и обновление просмотра агентов
Новости

Claude Code v2.1.162: информация об ожидании сессии, исправление тайм-аута MCP и обновление просмотра агентов

Claude Code v2.1.162 добавляет поле waitingFor в вывод --json, исправляет ошибку таймаута MCP менее 1000 мс, улучшает отрисовку терминала для представления агентов и многое другое. Подробности внутри.

OpenClawRadar
Пользователи сообщают о регрессе Claude Opus 4.7 в рассуждении и разговоре
Новости

Пользователи сообщают о регрессе Claude Opus 4.7 в рассуждении и разговоре

Opus 4.7 представляет новый токенизатор, который требует на 30–50% больше токенов, демонстрирует метанаррацию, нестабильность позиции и планирование без выполнения — что делает его хуже для технического сотрудничества, чем 4.6.

OpenClawRadar
YC-Bench тестирует LLM в роли CEO стартапов, GLM-5 демонстрирует высокую рентабельность
Новости

YC-Bench тестирует LLM в роли CEO стартапов, GLM-5 демонстрирует высокую рентабельность

Исследователи создали YC-Bench — бенчмарк, в котором ИИ-модели выступают в роли генеральных директоров симулированных стартапов в течение года, управляя сотрудниками, контрактами и заработной платой. GLM-5 достиг средних финальных средств в размере 1,21 млн долларов при стоимости 7,62 доллара за запуск, показав результат в пределах 5% от Claude Opus 4.6, который стоил 86 долларов за запуск.

OpenClawRadar
完全转型为AI工程师:不再接触代码
Новости

完全转型为AI工程师:不再接触代码

Макс Хейер описывает рабочий процесс, где агенты пишут весь код, а он только читает diff'ы, пишет спецификации и проверяет результат. Важен вкус — оценивать код сложнее, чем писать его.

OpenClawRadar