Бенчмаркинг последних ИИ-моделей: Восхождение экстремальных моделей

Недавний бенчмаркинг 40 новых AI-моделей выявляет значительные изменения в балансе цены и производительности. Сосредоточив внимание на Kimi k2.5 и Claude Opus 4.6, анализ демонстрирует разделение на два экстремума: 'God Mode' и 'Flash Mode', что делает модели среднего уровня неэффективными.
Ключевые детали
- Ситуация с Kimi k2.5: Попытки провести бенчмаркинг Kimi k2.5 оказались безуспешными из-за постоянных ошибок 'No Content', вероятно, из-за перегрузки. Тем не менее, Kimi-k2-Thinking показал удовлетворительные результаты для сложных задач рассуждения с ~15 TPS.
- доминирование скорости: Для приложений с чувствительностью к задержке модель Liquid LFM 2.5 оказалась самой быстрой, достигая ~359 токенов в секунду, за ней следует Ministral 3B с ~293 токенами в секунду.
- Экономическая эффективность: Ministral 3B выделяется как наиболее экономически эффективное решение, costing $0.10/1M входных токенов. Он ~17x дешевле и ~40% быстрее, чем GPT-5.2 Codex, что делает его выгодным вариантом по сравнению с более дорогими предложениями.
Рекомендуется избегать моделей среднего уровня стоимостью от $0.50 до $1.00, так как они не предлагают конкурентоспособной производительности. В зависимости от ваших потребностей, выбирайте модели более высокого ценового сегмента, такие как Opus/GPT-5 для интеллекта, или выбирайте экономичную скорость с Liquid/Mistral.
📖 Читать полный источник: r/LocalLLaMA
👀 Смотрите также

Claude Code v2.1.162: информация об ожидании сессии, исправление тайм-аута MCP и обновление просмотра агентов
Claude Code v2.1.162 добавляет поле waitingFor в вывод --json, исправляет ошибку таймаута MCP менее 1000 мс, улучшает отрисовку терминала для представления агентов и многое другое. Подробности внутри.

Пользователи сообщают о регрессе Claude Opus 4.7 в рассуждении и разговоре
Opus 4.7 представляет новый токенизатор, который требует на 30–50% больше токенов, демонстрирует метанаррацию, нестабильность позиции и планирование без выполнения — что делает его хуже для технического сотрудничества, чем 4.6.

YC-Bench тестирует LLM в роли CEO стартапов, GLM-5 демонстрирует высокую рентабельность
Исследователи создали YC-Bench — бенчмарк, в котором ИИ-модели выступают в роли генеральных директоров симулированных стартапов в течение года, управляя сотрудниками, контрактами и заработной платой. GLM-5 достиг средних финальных средств в размере 1,21 млн долларов при стоимости 7,62 доллара за запуск, показав результат в пределах 5% от Claude Opus 4.6, который стоил 86 долларов за запуск.

完全转型为AI工程师:不再接触代码
Макс Хейер описывает рабочий процесс, где агенты пишут весь код, а он только читает diff'ы, пишет спецификации и проверяет результат. Важен вкус — оценивать код сложнее, чем писать его.