Бенчмарк SPLICE показывает, что визуально-языковые модели испытывают трудности с временными рассуждениями и полагаются на языковые пресуппозиции.

✍️ OpenClawRadar📅 Опубликовано: 15 марта 2026 г.🔗 Source
Бенчмарк SPLICE показывает, что визуально-языковые модели испытывают трудности с временными рассуждениями и полагаются на языковые пресуппозиции.
Ad

Результаты бенчмарка SPLICE

Бенчмарк SPLICE проверяет временное, причинно-следственное, пространственное, контекстуальное и логическое мышление, заставляя модели восстанавливать правильную последовательность перемешанных видеоклипов. Исследование, соавтором которого является автор исходного поста, было опубликовано на EMNLP 2025.

Подробности производительности моделей

Протестированные модели включали Gemini Flash (1.5 и 2.0), Qwen2-VL (7B и 72B), InternVL2.5 и LLaVA-OneVision. Gemini 2.0 Flash набрала 51% в задаче только на визуальной информации, в то время как человеческий результат составил 85%. Модели с открытым исходным кодом показали значительно более слабые результаты:

  • LLaVA-OneVision-72B едва превзошла случайное угадывание в настройке только на визуальной информации
  • InternVL2.5-78B показала схожий низкий результат
  • Qwen2-VL-72B достигла лишь около 30% в настройке только на визуальной информации
  • Qwen2-VL-7B показала результат на уровне 72B-варианта, что говорит о том, что масштабирование языковой модели не помогает, когда узким местом является визуальный энкодер

Зависимость от языковых приоритетов

Когда были добавлены написанные человеком текстовые аннотации, описывающие содержание клипов, производительность моделей значительно выросла, в то время как человеческий результат остался неизменным. Это указывает на то, что модели полагаются на языковые приоритеты, чтобы компенсировать слабое визуальное понимание. Примечательно, что Qwen2-VL-72B превзошла Gemini в рассуждениях только на тексте.

Ad

Поведение с визуальными «ярлыками»

Модели продемонстрировали проблемные паттерны рассуждений. Когда первый и последний видеоклипы выглядели визуально похожими (например, открытие и закрытие дверцы принтера), модели предсказывали, что эти клипы являются соседними, в 57% случаев, по сравнению с 2,5% у людей и 27% случайного шанса. Это говорит о том, что модели сопоставляют паттерны на основе визуального сходства, а не рассуждают о событиях.

Ограничения тестирования и будущая работа

Исследование не тестировало Claude (который не поддерживает видео-ввод) или модели OpenAI (которые не могли надёжно обрабатывать многовидео-ввод во время тестирования). Набор данных является публичным, и автор поста отмечает, что более новые модели, такие как Gemini 3 Flash и Qwen3-VL (с нативным контекстом 256K, улучшенным пространственно-временным моделированием и вариантами MoE до 235B), следует протестировать на SPLICE, чтобы увидеть, сохраняются ли проблемы с языковыми приоритетами. Предварительное тестирование предполагает, что проблема языкового приоритета сохраняется, хотя статистическая значимость ещё не установлена для всех экспериментальных выборок.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Смотрите также

sseanliu/VisionClaw предоставляет помощь ИИ в реальном времени для умных очков Meta Ray-Ban.
Новости

sseanliu/VisionClaw предоставляет помощь ИИ в реальном времени для умных очков Meta Ray-Ban.

VisionClaw от sseanliu предлагает революционного помощника ИИ для умных очков Meta Ray-Ban, объединяя голосовые команды, визуальные данные и агентные действия с использованием Gemini Live и OpenClaw.

OpenClawRadar
Эволюция архитектуры KV-кэша: от GPT-2 до Mamba
Новости

Эволюция архитектуры KV-кэша: от GPT-2 до Mamba

Анализ затрат памяти на KV-кэш показывает, что GPT-2 использовал 300 КБайт/токен, Llama 3 сократил этот показатель до 128 КБайт/токен с помощью группового запросного внимания, а DeepSeek V3 достиг 68,6 КБайт/токен с использованием многоголового латентного внимания. Mamba/SSM полностью устраняют KV-кэш за счёт фиксированного размера скрытых состояний.

OpenClawRadar
OpenClaw 2026.3.24: Конфигурация моста удалена, экономия токенов Heartbeat, обнаружение петель.
Новости

OpenClaw 2026.3.24: Конфигурация моста удалена, экономия токенов Heartbeat, обнаружение петель.

OpenClaw 2026.3.24 удаляет устаревший раздел конфигурации моста из openclaw.json, добавляет isolatedSession: true в конфигурацию heartbeat для снижения затрат токенов с ~100K до 2-5K за запуск, а также представляет новые функции, включая imageGenerationModel, tools.loopDetection, channels.modelByChannel, встроенные псевдонимы моделей и pdfModel.

OpenClawRadar
Военные США использовали ИИ Claude для ударов по Ирану, несмотря на запрет Трампа
Новости

Военные США использовали ИИ Claude для ударов по Ирану, несмотря на запрет Трампа

По сообщениям, американские военные использовали ИИ-модель Claude компании Anthropic для разведки, выбора целей и моделирования боевых действий во время совместных ударов США и Израиля по Ирану, несмотря на приказ Дональда Трампа федеральным агентствам прекратить использование Claude за несколько часов до атаки.

OpenClawRadar