O Benchmark SPLICE Revela que os VLMs Têm Dificuldade com o Raciocínio Temporal e Dependem de Preconceitos Linguísticos

Resultados do Benchmark SPLICE
O benchmark SPLICE testa raciocínio temporal, causal, espacial, contextual e de senso comum, fazendo com que os modelos reconstruam a sequência correta de clipes de vídeo embaralhados. A pesquisa, coautoria do autor original, foi publicada na EMNLP 2025.
Detalhes do Desempenho dos Modelos
Os modelos testados incluíram Gemini Flash (1.5 e 2.0), Qwen2-VL (7B e 72B), InternVL2.5 e LLaVA-OneVision. O Gemini 2.0 Flash obteve 51% na tarefa apenas visual, enquanto o desempenho humano foi de 85%. Modelos de código aberto tiveram dificuldades significativas:
- LLaVA-OneVision-72B pontuou pouco acima do acaso aleatório na configuração apenas visual
- InternVL2.5-78B teve desempenho igualmente fraco
- Qwen2-VL-72B alcançou apenas cerca de 30% no modo apenas visual
- Qwen2-VL-7B teve desempenho equivalente à variante de 72B, sugerindo que escalar o modelo de linguagem não ajuda quando o gargalo está no codificador visual
Dependência de Prioridades Linguísticas
Quando anotações de texto escritas por humanos descrevendo o conteúdo dos clipes foram adicionadas, o desempenho dos modelos aumentou significativamente, enquanto o desempenho humano permaneceu inalterado. Isso indica que os modelos dependem de prioridades linguísticas para compensar a compreensão visual fraca. Notavelmente, o Qwen2-VL-72B superou o Gemini no raciocínio apenas com texto.
Comportamento de Atalhos Visuais
Os modelos demonstraram padrões de raciocínio problemáticos. Quando o primeiro e o último clipe de vídeo pareciam visualmente semelhantes (como abrir e fechar a porta de uma impressora), os modelos previram que esses clipes eram adjacentes 57% das vezes, comparado a 2,5% para humanos e 27% de chance aleatória. Isso sugere que os modelos estão correspondendo padrões de similaridade visual em vez de raciocinar sobre eventos.
Limitações dos Testes e Trabalhos Futuros
A pesquisa não testou o Claude (que não suporta entrada de vídeo) ou modelos da OpenAI (que não conseguiam lidar com entrada de múltiplos vídeos de forma confiável no momento dos testes). O conjunto de dados é público, e o autor observa que modelos mais novos como o Gemini 3 Flash e Qwen3-VL (com contexto intercalado nativo de 256K, modelagem espaço-temporal aprimorada e variantes MoE de até 235B) devem ser testados no SPLICE para ver se os problemas de prioridades linguísticas persistem. Testes preliminares sugerem que o problema da prioridade linguística permanece, embora a significância estatística não tenha sido estabelecida em todas as amostras experimentais.
📖 Read the full source: r/LocalLLaMA
👀 See Also

A Anthropic Abandona Compromisso-Chave de Segurança de sua Política de Escalabilidade Responsável
A Anthropic removeu o compromisso central de sua Política de Escalonamento Responsável que exigia garantir medidas de segurança adequadas antes de treinar sistemas de IA, citando pressão competitiva e a necessidade de continuar o desenvolvimento.

Claude oferece crédito de uso extra para os planos Pro, Max e Team
O Claude está oferecendo um crédito de uso extra único para assinantes dos planos Pro, Max e Team, igual ao valor da sua assinatura. O crédito pode ser usado no Claude, Claude Code, Claude Cowork e produtos de terceiros.

A Merlin Research lança o modelo Qwen3.5-4B-Safety-Thinking para raciocínio estruturado.
A Merlin Research lançou o Qwen3.5-4B-Safety-Thinking, um modelo de raciocínio alinhado à segurança com 4 bilhões de parâmetros, construído sobre o Qwen3.5. O modelo foi projetado para 'pensamento' estruturado e segurança em cenários do mundo real, incluindo sistemas de agentes.

Modo Automático do Claude Code Torna-se Padrão: Por Que a Anthropic Parou de Confiar nos Humanos
O Auto Mode do Claude Code, que executa tarefas agênticas com intervenção humana mínima, está se tornando o padrão devido à crença de que a supervisão humana desacelera os fluxos de trabalho e introduz erros.