Результаты тестирования на визуальное мышление для 15 мультимодальных моделей искусственного интеллекта

✍️ OpenClawRadar📅 Опубликовано: 28 февраля 2026 г.🔗 Source
Результаты тестирования на визуальное мышление для 15 мультимодальных моделей искусственного интеллекта
Ad

Обзор тестирования

AIMultiple провёл тестирование визуального мышления 15 ведущих мультимодальных моделей ИИ, используя 200 вопросов на основе визуальных данных. Тестирование было разделено на два отдельных направления: 100 вопросов на понимание графиков, сфокусированных на интерпретации визуализации данных, и 100 вопросов по визуальной логике, охватывающих распознавание паттернов и пространственное мышление.

Методология

Каждый вопрос был запущен 5 раз для обеспечения статистической достоверности. Тестирование специально проверяло способность моделей интерпретировать визуализации данных и решать задачи визуальной логики, требующие распознавания паттернов и пространственного мышления.

Ad

Результаты

Общий рейтинг показывает лидерство Gemini-3.1-pro-preview и Gemini-3-pro-preview, за которыми следуют GPT-5.2, Kimi-K2.5 и GPT-5.2-pro. Результаты выявляют устойчивую закономерность для большинства систем: модели лучше справляются с задачами интерпретации данных на графиках, чем с задачами визуальной логики, где производительность значительно снижается.

Для разработчиков, работающих с мультимодальными системами ИИ, это тестирование предоставляет конкретные данные об относительных преимуществах в различных типах задач визуального мышления. Разрыв в производительности между интерпретацией графиков и визуальной логикой указывает на то, что текущие модели обладают более сильными возможностями в обработке структурированных визуальных данных, чем в абстрактном пространственном мышлении.

📖 Read the full source: r/ClaudeAI

Ad

👀 Смотрите также

Система агента OpenClaw сломана после последних обновлений
Новости

Система агента OpenClaw сломана после последних обновлений

Недавние обновления OpenClaw нарушили основную функциональность агентов: пользователи сообщают, что агентов невозможно надёжно создавать или запускать. Ранее система позволяла создавать агентов, они корректно отображались, запускались рабочие процессы и использовались для реальных задач.

OpenClawRadar
🦀
Новости

OpenClaw 2026.8.2:内部上下文块泄露至Telegram文本

Ошибка в OpenClaw 2026.8.2 при опросе Telegram приводит к утечке внутреннего контекстного блока в видимый текст, из-за чего агенты отказываются выполнять легитимные инструкции и сигнализируют о prompt injection.

OpenClawRadar
Claude Code v2.1.201 отменяет системную роль в середине разговора для сессий Sonnet 5
Новости

Claude Code v2.1.201 отменяет системную роль в середине разговора для сессий Sonnet 5

Claude Code v2.1.201 убирает системную роль в середине разговора для напоминаний об обвязке в сеансах Claude Sonnet 5, упрощая контекст чата.

OpenClawRadar
Исследование трассировки схем от Anthropic раскрывает внутренние механизмы Claude 3.5 Haiku.
Новости

Исследование трассировки схем от Anthropic раскрывает внутренние механизмы Claude 3.5 Haiku.

Anthropic опубликовала исследование по трассировке схем, проведённое на упрощённой версии Claude 3.5 Haiku, которое выявило шесть конкретных поведенческих паттернов, включая состояние по умолчанию «Я не знаю», написание стихов с конца и двухпутевую обработку математических задач.

OpenClawRadar