O Benchmark SPLICE Revela que os VLMs Têm Dificuldade com o Raciocínio Temporal e Dependem de Preconceitos Linguísticos

Resultados do Benchmark SPLICE
O benchmark SPLICE testa raciocínio temporal, causal, espacial, contextual e de senso comum, fazendo com que os modelos reconstruam a sequência correta de clipes de vídeo embaralhados. A pesquisa, coautoria do autor original, foi publicada na EMNLP 2025.
Detalhes do Desempenho dos Modelos
Os modelos testados incluíram Gemini Flash (1.5 e 2.0), Qwen2-VL (7B e 72B), InternVL2.5 e LLaVA-OneVision. O Gemini 2.0 Flash obteve 51% na tarefa apenas visual, enquanto o desempenho humano foi de 85%. Modelos de código aberto tiveram dificuldades significativas:
- LLaVA-OneVision-72B pontuou pouco acima do acaso aleatório na configuração apenas visual
- InternVL2.5-78B teve desempenho igualmente fraco
- Qwen2-VL-72B alcançou apenas cerca de 30% no modo apenas visual
- Qwen2-VL-7B teve desempenho equivalente à variante de 72B, sugerindo que escalar o modelo de linguagem não ajuda quando o gargalo está no codificador visual
Dependência de Prioridades Linguísticas
Quando anotações de texto escritas por humanos descrevendo o conteúdo dos clipes foram adicionadas, o desempenho dos modelos aumentou significativamente, enquanto o desempenho humano permaneceu inalterado. Isso indica que os modelos dependem de prioridades linguísticas para compensar a compreensão visual fraca. Notavelmente, o Qwen2-VL-72B superou o Gemini no raciocínio apenas com texto.
Comportamento de Atalhos Visuais
Os modelos demonstraram padrões de raciocínio problemáticos. Quando o primeiro e o último clipe de vídeo pareciam visualmente semelhantes (como abrir e fechar a porta de uma impressora), os modelos previram que esses clipes eram adjacentes 57% das vezes, comparado a 2,5% para humanos e 27% de chance aleatória. Isso sugere que os modelos estão correspondendo padrões de similaridade visual em vez de raciocinar sobre eventos.
Limitações dos Testes e Trabalhos Futuros
A pesquisa não testou o Claude (que não suporta entrada de vídeo) ou modelos da OpenAI (que não conseguiam lidar com entrada de múltiplos vídeos de forma confiável no momento dos testes). O conjunto de dados é público, e o autor observa que modelos mais novos como o Gemini 3 Flash e Qwen3-VL (com contexto intercalado nativo de 256K, modelagem espaço-temporal aprimorada e variantes MoE de até 235B) devem ser testados no SPLICE para ver se os problemas de prioridades linguísticas persistem. Testes preliminares sugerem que o problema da prioridade linguística permanece, embora a significância estatística não tenha sido estabelecida em todas as amostras experimentais.
📖 Read the full source: r/LocalLLaMA
👀 See Also

Índia e EAU fazem parceria em soberania de IA com supercomputadores Cerebras
Índia e Emirados Árabes Unidos unem forças para implantar um supercomputador de IA da Cerebras em território indiano, contornando gigantes da nuvem dos EUA. O acordo com a G42 concede à Índia propriedade da máquina e controle de governança de dados.

Perda Persistente de Dados em Projetos Claude: Conversas Desaparecendo Sem Recuperação
Um escritor de textos longos relata perder dias inteiros de trabalho em Projetos Claude devido a conversas desaparecerem da lista de bate-papo do projeto, impossíveis de pesquisar e recuperar, sem resposta do suporte da Anthropic após três incidentes.

Claude AI apresenta atualizações do plugin Cowork com personalização empresarial e novos conectores
A Claude AI lançou atualizações do plugin Cowork que permitem aos administradores empresariais criar marketplaces de plugins privados e adicionar conectores para Google Workspace, Docusign, Apollo e outras ferramentas. Uma nova prévia de pesquisa permite que o Claude trabalhe entre Excel e PowerPoint para análise de ponta a ponta e criação de apresentações.

Manutentor do kernel Linux relata mudança súbita na qualidade de relatórios de bugs gerados por IA
Greg Kroah-Hartman afirma que os relatórios de bugs gerados por IA para o kernel do Linux passaram de 'lixo de IA' para relatórios legítimos há cerca de um mês, com equipes de segurança de código aberto em diversos projetos observando a mesma mudança. A equipe do kernel está lidando com o aumento com ferramentas como o Sashiko para automação de revisão.