MiMo-V2.5-Pro бенчмарк: сильное социально-дедуктивное рассуждение, хорошее соотношение цена/качество по сравнению с K2.6

✍️ OpenClawRadar📅 Опубликовано: 1 мая 2026 г.🔗 Source
MiMo-V2.5-Pro бенчмарк: сильное социально-дедуктивное рассуждение, хорошее соотношение цена/качество по сравнению с K2.6
Ad

MiMo-V2.5-Pro, последняя модель Xiaomi с открытыми весами, прошла бенчмаркинг в автономных играх Blood on the Clocktower — сложной социальной дедуктивной игры, похожей на Мафию/Оборотней. Бенчмарк, созданный пользователем Reddit cjami, сталкивает модели друг против друга в полных играх, оценивая рассуждение, обман и использование инструментов.

Ключевые результаты

  • Процент побед: 88% за команду Добра, 48% за команду Зла — в целом высокий, но однобокий. Игра за Зло — основная слабость по сравнению с Kimi K2.6.
  • Эффективность токенов: 183 639 выходных токенов на игру, аналогично Gemini 3.1 Pro. Сравните с Kimi K2.6: 580 000 токенов (в 3 раза длиннее).
  • Стоимость за игру: $0.99 — менее половины стоимости Kimi K2.6 ($2.65) и значительно ниже Claude Opus 4.6 ($3.76).
  • Длительность матча: 2-3 часа (против 10-15 часов у Kimi K2.6 из-за многословных рассуждений).
  • Частота ошибок вызова инструментов: 0.4% — надежно для автономных агентских рабочих процессов.

Примечательная производительность

Сильные рассуждения в условиях неопределенности: пример мышления с точки зрения других против GPT 5.5 и чистые дедукции, выигравшие игру.

Ad

Примечательные ошибки

Практический вывод

Для разработчиков, которым нужна модель с открытыми весами и сильными рассуждениями в мультиагентных или теоретико-игровых сценариях, MiMo-V2.5-Pro предлагает наилучшее соотношение цены и качества среди топ-моделей — более низкая стоимость, более быстрый вывод и разумная надежность, хотя есть возможности для улучшения в состязательных ролях.

Полные транскрипты и логи игр: MiMo-V2.5-Pro на Clocktower Radio. Методология: Как это работает.

📖 Читать полный источник: r/LocalLLaMA

Ad

👀 Смотрите также

创始人代理:具有快速检索功能的网站语音AI
Новости

创始人代理:具有快速检索功能的网站语音AI

Moss создал голосового ИИ-агента для своего веб-сайта, который мгновенно отвечает на вопросы посетителей с помощью быстрого поиска. Теперь это продукт под названием Founding Agent.

OpenClawRadar
«Запад забыл, как строить: крах оборонной цепочки поставок и уроки для разработки программного обеспечения»
Новости

«Запад забыл, как строить: крах оборонной цепочки поставок и уроки для разработки программного обеспечения»

Raytheon пришлось вернуть на работу инженеров-пенсионеров, чтобы возобновить производство ракет Stinger по 40-летним бумажным чертежам. Та же картина сейчас повторяется в программном обеспечении, где десятилетия оптимизации затрат привели к атрофии кадрового резерва и институциональных знаний.

OpenClawRadar
Исследование ETH Zurich ставит под сомнение ценность файлов AGENTS.md для ИИ-агентов в программировании
Новости

Исследование ETH Zurich ставит под сомнение ценность файлов AGENTS.md для ИИ-агентов в программировании

Новое исследование ETH Zurich показывает, что файлы AGENTS.md, сгенерированные LLM, снижают успешность выполнения задач ИИ-агентами на 3% и увеличивают затраты на вывод более чем на 20%, в то время как файлы, написанные человеком, дают лишь незначительный прирост в 4% при аналогичном увеличении затрат.

OpenClawRadar
CC v2.1.122: Удаление системных подсказок, обновление отладки и повышение уверенности в расписании
Новости

CC v2.1.122: Удаление системных подсказок, обновление отладки и повышение уверенности в расписании

Claude Code CC v2.1.122 удаляет отдельный подсказку для четвертой фазы в режиме плана, улучшает резервный контекст отладки демона и повышает порог уверенности для предложений /schedule с 70%+ до 85%+.

OpenClawRadar