Бенчмаркинг последних ИИ-моделей: Восхождение экстремальных моделей

Недавний бенчмаркинг 40 новых AI-моделей выявляет значительные изменения в балансе цены и производительности. Сосредоточив внимание на Kimi k2.5 и Claude Opus 4.6, анализ демонстрирует разделение на два экстремума: 'God Mode' и 'Flash Mode', что делает модели среднего уровня неэффективными.
Ключевые детали
- Ситуация с Kimi k2.5: Попытки провести бенчмаркинг Kimi k2.5 оказались безуспешными из-за постоянных ошибок 'No Content', вероятно, из-за перегрузки. Тем не менее, Kimi-k2-Thinking показал удовлетворительные результаты для сложных задач рассуждения с ~15 TPS.
- доминирование скорости: Для приложений с чувствительностью к задержке модель Liquid LFM 2.5 оказалась самой быстрой, достигая ~359 токенов в секунду, за ней следует Ministral 3B с ~293 токенами в секунду.
- Экономическая эффективность: Ministral 3B выделяется как наиболее экономически эффективное решение, costing $0.10/1M входных токенов. Он ~17x дешевле и ~40% быстрее, чем GPT-5.2 Codex, что делает его выгодным вариантом по сравнению с более дорогими предложениями.
Рекомендуется избегать моделей среднего уровня стоимостью от $0.50 до $1.00, так как они не предлагают конкурентоспособной производительности. В зависимости от ваших потребностей, выбирайте модели более высокого ценового сегмента, такие как Opus/GPT-5 для интеллекта, или выбирайте экономичную скорость с Liquid/Mistral.
📖 Читать полный источник: r/LocalLLaMA
👀 Смотрите также

Claude Desktop против Claude Code: Различия в системных промптах влияют на поведение ИИ
Пользователь сообщает о значительных различиях в поведении между Claude Desktop и Claude Code, несмотря на использование одной и той же модели Claude Opus, аккаунта и настроек. Различия включают рефлекторное согласие, непрошенные советы о благополучии и бизнес-ориентированную подачу в Desktop, которые не встречаются в Code.

Пользователь Reddit сообщает о 18,8 ток/с при CPU-инференсе модели Qwen 3 30B Q4 на архитектуре Zen 4.
Пользователь на r/LocalLLaMA протестировал Qwen 3 30B Q4 на процессоре и достиг 18,8 токенов в секунду с процессором Zen 4 и памятью DDR5, что значительно превысило ожидания в 3-5 ток/с.

Microsoft BitNet позволяет выполнять вывод LLM с 100 миллиардами параметров на одном процессоре.
Проект Microsoft с открытым исходным кодом BitNet обеспечивает вывод 100B-параметрической LLM со скоростью 5-7 токенов в секунду на одном CPU, при этом 2B-параметрическая модель использует 0,4 ГБ памяти и имеет задержку 29 мс, соответствуя полноразрядным моделям в тестах.

Гибридная архитектура ИИ: компоненты с открытым исходным кодом и проприетарные модели логического вывода
Практическая гибридная архитектура ИИ становится реальностью: 89% организаций используют компоненты с открытым исходным кодом для снижения затрат более чем на 50%, в то время как проприетарные модели справляются со сложными задачами логического вывода. Фреймворки с открытым исходным кодом предлагают прозрачность и возможности тонкой настройки без переговоров о лицензировании.