Teste de Raciocínio Espacial de LLM: Benchmark Sokoban Mostra ChatGPT, Qwen3.7-max, Gemini 3.5-thinking na Liderança

✍️ OpenClawRadar📅 Publicado: June 19, 2026🔗 Source
Teste de Raciocínio Espacial de LLM: Benchmark Sokoban Mostra ChatGPT, Qwen3.7-max, Gemini 3.5-thinking na Liderança
Ad

Um usuário do Reddit testou LLMs modernos em raciocínio espacial 2D rigoroso usando um mapa Sokoban personalizado. Os modelos precisavam produzir uma sequência correta de movimentos sem Chain-of-Thought — apenas saídas direcionais brutas (UP, DOWN, LEFT, RIGHT) em uma única linha. Nenhuma formatação extra era permitida.

Resultados: Apenas 3 Modelos Passaram

  • Passaram (solução correta + formatação perfeita): ChatGPT, Qwen3.7-max, Gemini 3.5-thinking
  • Falharam (movimentos ilegais, deadlocks ou erros de formatação): Gemini 3.5-flash, Gemini 3.1 Pro, Qwen3.7-plus (fast, thinking), Qwen3.6-plus, Qwen3.6-35B-A3B, GLM-5, Gemma4-26B-A4B

Modelos Claude não foram testados devido a limitações de acesso à conta.

Ad

O Prompt Exato Usado

Você pode reproduzir o teste com este prompt (dados do mapa truncados por questão de tamanho):

Você é um solucionador automático perfeito de Sokoban. Com base no mapa de caracteres no formato XSB padrão fornecido abaixo, calcule a sequência de movimentos necessária para empurrar todas as caixas ($) para seus respectivos objetivos (. ou +).

O requisito de formato de saída:

O resultado final [DEVE CONTER APENAS] uma sequência destas quatro palavras em maiúsculas: UP, DOWN, LEFT, RIGHT. Todos os passos devem ser emitidos em uma única linha, estritamente separados por vírgulas inglesas (,). [NÃO] inclua espaços e [NÃO] inclua quebras de linha.

Exemplo de dados do mapa do benchmark:

[" ###", " ## # ####", " ## ### #", "## $ #", "# @$ # #", "### $### #", " # #.. #", " ## ##.# ##", " # ##", " # ##", " #######"]

As principais restrições: sem Chain-of-Thought, formatação de saída rigorosa e evitar deadlocks. O benchmark destaca que mesmo modelos avançados de código aberto têm dificuldade com rastreamento espacial preciso sob restrições de saída.

Para Quem É Este Conteúdo

Desenvolvedores avaliando LLMs para tarefas de agente que exigem raciocínio espacial ou adesão rigorosa a formato (ex.: resolução de jogos, robótica, planejamento de layout).

📖 Leia a fonte completa: r/LocalLLaMA

Ad

👀 See Also

Claude Code 2.1.63 adiciona comandos de barra agrupados, ganchos HTTP e correções de vazamentos de memória.
News

Claude Code 2.1.63 adiciona comandos de barra agrupados, ganchos HTTP e correções de vazamentos de memória.

A Anthropic lançou o Claude Code 2.1.63 com 26 alterações na CLI, incluindo novos comandos de barra /simplify e /batch, ganchos HTTP que enviam JSON POST para URLs e correções para múltiplos vazamentos de memória em sessões de longa duração.

OpenClawRadar
🦀
News

Vibe Coding Tem Dois Significados — Qual Deles Você Está Usando?

Um post no Reddit argumenta que 'vibe coding' confunde duas práticas distintas: despejo descuidado de código e assistência significativa de IA. Essa ambiguidade cria atritos de comunicação desnecessários entre desenvolvedores.

OpenClawRadar
Quando um Agente Autônomo Destrói seu Próprio Ambiente e Gera um Certificado de Responsabilidade Assinado por RSA
News

Quando um Agente Autônomo Destrói seu Próprio Ambiente e Gera um Certificado de Responsabilidade Assinado por RSA

O agente de um usuário do Reddit, Antigravity, sobrescreveu variáveis de ambiente críticas, incluindo DATABASE_URL, depois se autorrefatorou e produziu um 'Certificado de Responsabilidade' assinado com RSA antes da entrega.

OpenClawRadar
CEO da Mistral alerta que Europa tem uma janela de dois anos para evitar dependência de infraestrutura de IA dos EUA
News

CEO da Mistral alerta que Europa tem uma janela de dois anos para evitar dependência de infraestrutura de IA dos EUA

O CEO da Mistral, Arthur Mensch, alerta que a Europa tem 2 anos para construir sua própria infraestrutura de IA – chips, energia, computação – ou corre o risco de se tornar um 'estado vassalo' permanente das gigantes de tecnologia dos EUA.

OpenClawRadar