MiMo-V2.5-Pro бенчмарк: сильное социально-дедуктивное рассуждение, хорошее соотношение цена/качество по сравнению с K2.6

✍️ OpenClawRadar📅 Опубликовано: 1 мая 2026 г.🔗 Source
MiMo-V2.5-Pro бенчмарк: сильное социально-дедуктивное рассуждение, хорошее соотношение цена/качество по сравнению с K2.6
Ad

MiMo-V2.5-Pro, последняя модель Xiaomi с открытыми весами, прошла бенчмаркинг в автономных играх Blood on the Clocktower — сложной социальной дедуктивной игры, похожей на Мафию/Оборотней. Бенчмарк, созданный пользователем Reddit cjami, сталкивает модели друг против друга в полных играх, оценивая рассуждение, обман и использование инструментов.

Ключевые результаты

  • Процент побед: 88% за команду Добра, 48% за команду Зла — в целом высокий, но однобокий. Игра за Зло — основная слабость по сравнению с Kimi K2.6.
  • Эффективность токенов: 183 639 выходных токенов на игру, аналогично Gemini 3.1 Pro. Сравните с Kimi K2.6: 580 000 токенов (в 3 раза длиннее).
  • Стоимость за игру: $0.99 — менее половины стоимости Kimi K2.6 ($2.65) и значительно ниже Claude Opus 4.6 ($3.76).
  • Длительность матча: 2-3 часа (против 10-15 часов у Kimi K2.6 из-за многословных рассуждений).
  • Частота ошибок вызова инструментов: 0.4% — надежно для автономных агентских рабочих процессов.

Примечательная производительность

Сильные рассуждения в условиях неопределенности: пример мышления с точки зрения других против GPT 5.5 и чистые дедукции, выигравшие игру.

Ad

Примечательные ошибки

Практический вывод

Для разработчиков, которым нужна модель с открытыми весами и сильными рассуждениями в мультиагентных или теоретико-игровых сценариях, MiMo-V2.5-Pro предлагает наилучшее соотношение цены и качества среди топ-моделей — более низкая стоимость, более быстрый вывод и разумная надежность, хотя есть возможности для улучшения в состязательных ролях.

Полные транскрипты и логи игр: MiMo-V2.5-Pro на Clocktower Radio. Методология: Как это работает.

📖 Читать полный источник: r/LocalLLaMA

Ad

👀 Смотрите также

Пещерный человек против подсказки "будь кратким": сравнение эффективности подсказок для сжатия в Клоде
Новости

Пещерный человек против подсказки "будь кратким": сравнение эффективности подсказок для сжатия в Клоде

Бенчмарк из 24 запросов по 5 вариантам показывает, что двухсловный запрос «будь краток.» соответствует «пещерному» сжатию как по количеству токенов, так и по качеству вывода, хотя пещерный стиль обеспечивает структурную согласованность и функции безопасного отключения.

OpenClawRadar
Удаление CLI OpenClaw 0.9 вызывает сбой в работе агента.
Новости

Удаление CLI OpenClaw 0.9 вызывает сбой в работе агента.

Пользователь сообщил, что попытка обновления OpenClaw через AI-агента привела к удалению CLI, что нарушило работу команд шлюза и функциональность чата в Telegram. OpenClaw 0.9 полностью отказался от CLI, удалив такие команды, как 'openclaw gateway start' и 'openclaw status'.

OpenClawRadar
Искусствоведы-ИИ не смогли отличить настоящий Моне от подделки, обнажив пустую критику
Новости

Искусствоведы-ИИ не смогли отличить настоящий Моне от подделки, обнажив пустую критику

Пользователь выложил настоящую картину Моне как сгенерированную ИИ, и критики подробно разобрали её «недостатки» — что подчёркивает разрыв между уверенной критикой и реальным пониманием ИИ-искусства vs. человеческого.

OpenClawRadar
NVIDIA представила процессор Vera для агентных задач искусственного интеллекта
Новости

NVIDIA представила процессор Vera для агентных задач искусственного интеллекта

NVIDIA представила процессор Vera CPU, специально разработанный для агентного ИИ и задач обучения с подкреплением. По заявлению компании, он обеспечивает на 50% более высокую производительность и вдвое большую эффективность по сравнению с традиционными процессорами для стоечных систем.

OpenClawRadar