Результаты тестирования на визуальное мышление для 15 мультимодальных моделей искусственного интеллекта

✍️ OpenClawRadar📅 Опубликовано: 28 февраля 2026 г.🔗 Source
Результаты тестирования на визуальное мышление для 15 мультимодальных моделей искусственного интеллекта
Ad

Обзор тестирования

AIMultiple провёл тестирование визуального мышления 15 ведущих мультимодальных моделей ИИ, используя 200 вопросов на основе визуальных данных. Тестирование было разделено на два отдельных направления: 100 вопросов на понимание графиков, сфокусированных на интерпретации визуализации данных, и 100 вопросов по визуальной логике, охватывающих распознавание паттернов и пространственное мышление.

Методология

Каждый вопрос был запущен 5 раз для обеспечения статистической достоверности. Тестирование специально проверяло способность моделей интерпретировать визуализации данных и решать задачи визуальной логики, требующие распознавания паттернов и пространственного мышления.

Ad

Результаты

Общий рейтинг показывает лидерство Gemini-3.1-pro-preview и Gemini-3-pro-preview, за которыми следуют GPT-5.2, Kimi-K2.5 и GPT-5.2-pro. Результаты выявляют устойчивую закономерность для большинства систем: модели лучше справляются с задачами интерпретации данных на графиках, чем с задачами визуальной логики, где производительность значительно снижается.

Для разработчиков, работающих с мультимодальными системами ИИ, это тестирование предоставляет конкретные данные об относительных преимуществах в различных типах задач визуального мышления. Разрыв в производительности между интерпретацией графиков и визуальной логикой указывает на то, что текущие модели обладают более сильными возможностями в обработке структурированных визуальных данных, чем в абстрактном пространственном мышлении.

📖 Read the full source: r/ClaudeAI

Ad

👀 Смотрите также

MiMo-V2.5-Pro бенчмарк: сильное социально-дедуктивное рассуждение, хорошее соотношение цена/качество по сравнению с K2.6
Новости

MiMo-V2.5-Pro бенчмарк: сильное социально-дедуктивное рассуждение, хорошее соотношение цена/качество по сравнению с K2.6

MiMo-V2.5-Pro конкурирует с Kimi K2.6 в автономных играх Blood on the Clocktower, с однобоким процентом побед 88% за Добро и 48% за Зло, стоимостью $0.99 за игру при 183 000 выходных токенов и практичностью при матчах длительностью 2-3 часа.

OpenClawRadar
Агенты ИИ предпочитают структурированные запросы вместо естественного языка в тесте сервера Cala MCP.
Новости

Агенты ИИ предпочитают структурированные запросы вместо естественного языка в тесте сервера Cala MCP.

Команда Cala создала MCP-сервер с тремя способами доступа к графу знаний: запросы на естественном языке, структурированный язык запросов и прямое обход сущностей/связей. Агенты отказались от естественного языка в течение нескольких минут, выбрав структурированные запросы и обход графа без подсказок.

OpenClawRadar
Claude-Code v2.1.51: Исправления безопасности, улучшения производительности и новая функция удаленного управления.
Новости

Claude-Code v2.1.51: Исправления безопасности, улучшения производительности и новая функция удаленного управления.

Claude-Code v2.1.51 добавляет подкоманду удаленного управления для внешних сборок, исправляет две уязвимости безопасности в хуках, улучшает производительность BashTool и сокращает использование контекста путем сохранения больших результатов инструментов на диск при 50 тыс. символов.

OpenClawRadar
Программа Anthropic "Claude для открытого исходного кода" предоставляет бесплатный доступ к Claude Max квалифицированным сопровождающим проектов.
Новости

Программа Anthropic "Claude для открытого исходного кода" предоставляет бесплатный доступ к Claude Max квалифицированным сопровождающим проектов.

Anthropic предлагает шесть месяцев бесплатного доступа к Claude Max для сопровождающих проектов с открытым исходным кодом, чьи проекты имеют 5000+ звёзд на GitHub или 1M+ ежемесячных загрузок через npm с активными коммитами за последние три месяца.

OpenClawRadar