Бенчмаркинг последних ИИ-моделей: Восхождение экстремальных моделей

✍️ OpenClawRadar📅 Опубликовано: 13 февраля 2026 г.🔗 Source
Бенчмаркинг последних ИИ-моделей: Восхождение экстремальных моделей
Ad

Недавний бенчмаркинг 40 новых AI-моделей выявляет значительные изменения в балансе цены и производительности. Сосредоточив внимание на Kimi k2.5 и Claude Opus 4.6, анализ демонстрирует разделение на два экстремума: 'God Mode' и 'Flash Mode', что делает модели среднего уровня неэффективными.

Ad

Ключевые детали

  • Ситуация с Kimi k2.5: Попытки провести бенчмаркинг Kimi k2.5 оказались безуспешными из-за постоянных ошибок 'No Content', вероятно, из-за перегрузки. Тем не менее, Kimi-k2-Thinking показал удовлетворительные результаты для сложных задач рассуждения с ~15 TPS.
  • доминирование скорости: Для приложений с чувствительностью к задержке модель Liquid LFM 2.5 оказалась самой быстрой, достигая ~359 токенов в секунду, за ней следует Ministral 3B с ~293 токенами в секунду.
  • Экономическая эффективность: Ministral 3B выделяется как наиболее экономически эффективное решение, costing $0.10/1M входных токенов. Он ~17x дешевле и ~40% быстрее, чем GPT-5.2 Codex, что делает его выгодным вариантом по сравнению с более дорогими предложениями.

Рекомендуется избегать моделей среднего уровня стоимостью от $0.50 до $1.00, так как они не предлагают конкурентоспособной производительности. В зависимости от ваших потребностей, выбирайте модели более высокого ценового сегмента, такие как Opus/GPT-5 для интеллекта, или выбирайте экономичную скорость с Liquid/Mistral.

📖 Читать полный источник: r/LocalLLaMA

Ad

👀 Смотрите также

Claude Desktop против Claude Code: Различия в системных промптах влияют на поведение ИИ
Новости

Claude Desktop против Claude Code: Различия в системных промптах влияют на поведение ИИ

Пользователь сообщает о значительных различиях в поведении между Claude Desktop и Claude Code, несмотря на использование одной и той же модели Claude Opus, аккаунта и настроек. Различия включают рефлекторное согласие, непрошенные советы о благополучии и бизнес-ориентированную подачу в Desktop, которые не встречаются в Code.

OpenClawRadar
Пользователь Reddit сообщает о 18,8 ток/с при CPU-инференсе модели Qwen 3 30B Q4 на архитектуре Zen 4.
Новости

Пользователь Reddit сообщает о 18,8 ток/с при CPU-инференсе модели Qwen 3 30B Q4 на архитектуре Zen 4.

Пользователь на r/LocalLLaMA протестировал Qwen 3 30B Q4 на процессоре и достиг 18,8 токенов в секунду с процессором Zen 4 и памятью DDR5, что значительно превысило ожидания в 3-5 ток/с.

OpenClawRadar
Microsoft BitNet позволяет выполнять вывод LLM с 100 миллиардами параметров на одном процессоре.
Новости

Microsoft BitNet позволяет выполнять вывод LLM с 100 миллиардами параметров на одном процессоре.

Проект Microsoft с открытым исходным кодом BitNet обеспечивает вывод 100B-параметрической LLM со скоростью 5-7 токенов в секунду на одном CPU, при этом 2B-параметрическая модель использует 0,4 ГБ памяти и имеет задержку 29 мс, соответствуя полноразрядным моделям в тестах.

OpenClawRadar
Гибридная архитектура ИИ: компоненты с открытым исходным кодом и проприетарные модели логического вывода
Новости

Гибридная архитектура ИИ: компоненты с открытым исходным кодом и проприетарные модели логического вывода

Практическая гибридная архитектура ИИ становится реальностью: 89% организаций используют компоненты с открытым исходным кодом для снижения затрат более чем на 50%, в то время как проприетарные модели справляются со сложными задачами логического вывода. Фреймворки с открытым исходным кодом предлагают прозрачность и возможности тонкой настройки без переговоров о лицензировании.

OpenClawRadar