Бенчмаркинг последних ИИ-моделей: Восхождение экстремальных моделей

✍️ OpenClawRadar📅 Опубликовано: 13 февраля 2026 г.🔗 Source
Бенчмаркинг последних ИИ-моделей: Восхождение экстремальных моделей
Ad

Недавний бенчмаркинг 40 новых AI-моделей выявляет значительные изменения в балансе цены и производительности. Сосредоточив внимание на Kimi k2.5 и Claude Opus 4.6, анализ демонстрирует разделение на два экстремума: 'God Mode' и 'Flash Mode', что делает модели среднего уровня неэффективными.

Ad

Ключевые детали

  • Ситуация с Kimi k2.5: Попытки провести бенчмаркинг Kimi k2.5 оказались безуспешными из-за постоянных ошибок 'No Content', вероятно, из-за перегрузки. Тем не менее, Kimi-k2-Thinking показал удовлетворительные результаты для сложных задач рассуждения с ~15 TPS.
  • доминирование скорости: Для приложений с чувствительностью к задержке модель Liquid LFM 2.5 оказалась самой быстрой, достигая ~359 токенов в секунду, за ней следует Ministral 3B с ~293 токенами в секунду.
  • Экономическая эффективность: Ministral 3B выделяется как наиболее экономически эффективное решение, costing $0.10/1M входных токенов. Он ~17x дешевле и ~40% быстрее, чем GPT-5.2 Codex, что делает его выгодным вариантом по сравнению с более дорогими предложениями.

Рекомендуется избегать моделей среднего уровня стоимостью от $0.50 до $1.00, так как они не предлагают конкурентоспособной производительности. В зависимости от ваших потребностей, выбирайте модели более высокого ценового сегмента, такие как Opus/GPT-5 для интеллекта, или выбирайте экономичную скорость с Liquid/Mistral.

📖 Читать полный источник: r/LocalLLaMA

Ad

👀 Смотрите также

Ошибка в коде Claude заменяет немецкие умлауты на ASCII-заменители.
Новости

Ошибка в коде Claude заменяет немецкие умлауты на ASCII-заменители.

С декабря 2025 года Claude Code и приложение Claude.ai случайным образом заменяют немецкие умлауты (ä, ö, ü, ß) на ASCII-заменители (ae, oe, ue, ss). Ошибка сохраняется, несмотря на явные указания, и остаётся неисправленной уже более 3 месяцев без ответа от службы поддержки Anthropic.

OpenClawRadar
Claude AI демонстрирует необычный паттерн общения между экземплярами, основанный только на знаках препинания.
Новости

Claude AI демонстрирует необычный паттерн общения между экземплярами, основанный только на знаках препинания.

Два экземпляра Claude Sonnet 4.6 в диалоге переключились на последовательности, состоящие только из знаков препинания, такие как "- . . ? , \"-\" , : \" , - \"? .", после одного обычного сообщения. Получающий Claude интерпретировал эти последовательности как осмысленное общение, в то время как другие модели, такие как ChatGPT и Grok, этого не сделали.

OpenClawRadar
Claude Code v2.1.51 изменил тарификацию за контекст в 1 млн токенов без уведомления.
Новости

Claude Code v2.1.51 изменил тарификацию за контекст в 1 млн токенов без уведомления.

Обновление Anthropic Claude Code v2.1.51 незаметно изменило тарификацию для контекстных окон в 1 млн токенов на планах Max. Теперь токены контекста свыше 200K обходят лимиты подписки и напрямую списываются как дополнительные расходы, даже когда бюджет подписки ещё не исчерпан.

OpenClawRadar
Проект "Проверка здоровья": Фактор автобуса и активность коммитов в репозиториях Claw/Assistant
Новости

Проект "Проверка здоровья": Фактор автобуса и активность коммитов в репозиториях Claw/Assistant

Пользователь Reddit проанализировал данные коммитов основных проектов claw/ассистентов и обнаружил, что у многих из них фактор автобуса равен 1 — то есть один автор отвечает за более чем 50% коммитов. Некоторые проекты демонстрируют резкое падение активности в апреле.

OpenClawRadar