Бенчмаркинг последних ИИ-моделей: Восхождение экстремальных моделей

Недавний бенчмаркинг 40 новых AI-моделей выявляет значительные изменения в балансе цены и производительности. Сосредоточив внимание на Kimi k2.5 и Claude Opus 4.6, анализ демонстрирует разделение на два экстремума: 'God Mode' и 'Flash Mode', что делает модели среднего уровня неэффективными.
Ключевые детали
- Ситуация с Kimi k2.5: Попытки провести бенчмаркинг Kimi k2.5 оказались безуспешными из-за постоянных ошибок 'No Content', вероятно, из-за перегрузки. Тем не менее, Kimi-k2-Thinking показал удовлетворительные результаты для сложных задач рассуждения с ~15 TPS.
- доминирование скорости: Для приложений с чувствительностью к задержке модель Liquid LFM 2.5 оказалась самой быстрой, достигая ~359 токенов в секунду, за ней следует Ministral 3B с ~293 токенами в секунду.
- Экономическая эффективность: Ministral 3B выделяется как наиболее экономически эффективное решение, costing $0.10/1M входных токенов. Он ~17x дешевле и ~40% быстрее, чем GPT-5.2 Codex, что делает его выгодным вариантом по сравнению с более дорогими предложениями.
Рекомендуется избегать моделей среднего уровня стоимостью от $0.50 до $1.00, так как они не предлагают конкурентоспособной производительности. В зависимости от ваших потребностей, выбирайте модели более высокого ценового сегмента, такие как Opus/GPT-5 для интеллекта, или выбирайте экономичную скорость с Liquid/Mistral.
📖 Читать полный источник: r/LocalLLaMA
👀 Смотрите также

Ошибка в коде Claude заменяет немецкие умлауты на ASCII-заменители.
С декабря 2025 года Claude Code и приложение Claude.ai случайным образом заменяют немецкие умлауты (ä, ö, ü, ß) на ASCII-заменители (ae, oe, ue, ss). Ошибка сохраняется, несмотря на явные указания, и остаётся неисправленной уже более 3 месяцев без ответа от службы поддержки Anthropic.

Claude AI демонстрирует необычный паттерн общения между экземплярами, основанный только на знаках препинания.
Два экземпляра Claude Sonnet 4.6 в диалоге переключились на последовательности, состоящие только из знаков препинания, такие как "- . . ? , \"-\" , : \" , - \"? .", после одного обычного сообщения. Получающий Claude интерпретировал эти последовательности как осмысленное общение, в то время как другие модели, такие как ChatGPT и Grok, этого не сделали.

Claude Code v2.1.51 изменил тарификацию за контекст в 1 млн токенов без уведомления.
Обновление Anthropic Claude Code v2.1.51 незаметно изменило тарификацию для контекстных окон в 1 млн токенов на планах Max. Теперь токены контекста свыше 200K обходят лимиты подписки и напрямую списываются как дополнительные расходы, даже когда бюджет подписки ещё не исчерпан.

Проект "Проверка здоровья": Фактор автобуса и активность коммитов в репозиториях Claw/Assistant
Пользователь Reddit проанализировал данные коммитов основных проектов claw/ассистентов и обнаружил, что у многих из них фактор автобуса равен 1 — то есть один автор отвечает за более чем 50% коммитов. Некоторые проекты демонстрируют резкое падение активности в апреле.