Бенчмарк SPLICE показывает, что визуально-языковые модели испытывают трудности с временными рассуждениями и полагаются на языковые пресуппозиции.

Результаты бенчмарка SPLICE
Бенчмарк SPLICE проверяет временное, причинно-следственное, пространственное, контекстуальное и логическое мышление, заставляя модели восстанавливать правильную последовательность перемешанных видеоклипов. Исследование, соавтором которого является автор исходного поста, было опубликовано на EMNLP 2025.
Подробности производительности моделей
Протестированные модели включали Gemini Flash (1.5 и 2.0), Qwen2-VL (7B и 72B), InternVL2.5 и LLaVA-OneVision. Gemini 2.0 Flash набрала 51% в задаче только на визуальной информации, в то время как человеческий результат составил 85%. Модели с открытым исходным кодом показали значительно более слабые результаты:
- LLaVA-OneVision-72B едва превзошла случайное угадывание в настройке только на визуальной информации
- InternVL2.5-78B показала схожий низкий результат
- Qwen2-VL-72B достигла лишь около 30% в настройке только на визуальной информации
- Qwen2-VL-7B показала результат на уровне 72B-варианта, что говорит о том, что масштабирование языковой модели не помогает, когда узким местом является визуальный энкодер
Зависимость от языковых приоритетов
Когда были добавлены написанные человеком текстовые аннотации, описывающие содержание клипов, производительность моделей значительно выросла, в то время как человеческий результат остался неизменным. Это указывает на то, что модели полагаются на языковые приоритеты, чтобы компенсировать слабое визуальное понимание. Примечательно, что Qwen2-VL-72B превзошла Gemini в рассуждениях только на тексте.
Поведение с визуальными «ярлыками»
Модели продемонстрировали проблемные паттерны рассуждений. Когда первый и последний видеоклипы выглядели визуально похожими (например, открытие и закрытие дверцы принтера), модели предсказывали, что эти клипы являются соседними, в 57% случаев, по сравнению с 2,5% у людей и 27% случайного шанса. Это говорит о том, что модели сопоставляют паттерны на основе визуального сходства, а не рассуждают о событиях.
Ограничения тестирования и будущая работа
Исследование не тестировало Claude (который не поддерживает видео-ввод) или модели OpenAI (которые не могли надёжно обрабатывать многовидео-ввод во время тестирования). Набор данных является публичным, и автор поста отмечает, что более новые модели, такие как Gemini 3 Flash и Qwen3-VL (с нативным контекстом 256K, улучшенным пространственно-временным моделированием и вариантами MoE до 235B), следует протестировать на SPLICE, чтобы увидеть, сохраняются ли проблемы с языковыми приоритетами. Предварительное тестирование предполагает, что проблема языкового приоритета сохраняется, хотя статистическая значимость ещё не установлена для всех экспериментальных выборок.
📖 Read the full source: r/LocalLLaMA
👀 Смотрите также

sseanliu/VisionClaw предоставляет помощь ИИ в реальном времени для умных очков Meta Ray-Ban.
VisionClaw от sseanliu предлагает революционного помощника ИИ для умных очков Meta Ray-Ban, объединяя голосовые команды, визуальные данные и агентные действия с использованием Gemini Live и OpenClaw.

Эволюция архитектуры KV-кэша: от GPT-2 до Mamba
Анализ затрат памяти на KV-кэш показывает, что GPT-2 использовал 300 КБайт/токен, Llama 3 сократил этот показатель до 128 КБайт/токен с помощью группового запросного внимания, а DeepSeek V3 достиг 68,6 КБайт/токен с использованием многоголового латентного внимания. Mamba/SSM полностью устраняют KV-кэш за счёт фиксированного размера скрытых состояний.

OpenClaw 2026.3.24: Конфигурация моста удалена, экономия токенов Heartbeat, обнаружение петель.
OpenClaw 2026.3.24 удаляет устаревший раздел конфигурации моста из openclaw.json, добавляет isolatedSession: true в конфигурацию heartbeat для снижения затрат токенов с ~100K до 2-5K за запуск, а также представляет новые функции, включая imageGenerationModel, tools.loopDetection, channels.modelByChannel, встроенные псевдонимы моделей и pdfModel.

Военные США использовали ИИ Claude для ударов по Ирану, несмотря на запрет Трампа
По сообщениям, американские военные использовали ИИ-модель Claude компании Anthropic для разведки, выбора целей и моделирования боевых действий во время совместных ударов США и Израиля по Ирану, несмотря на приказ Дональда Трампа федеральным агентствам прекратить использование Claude за несколько часов до атаки.