Teste de Raciocínio Espacial de LLM: Benchmark Sokoban Mostra ChatGPT, Qwen3.7-max, Gemini 3.5-thinking na Liderança

✍️ OpenClawRadar📅 Publicado: June 19, 2026🔗 Source
Teste de Raciocínio Espacial de LLM: Benchmark Sokoban Mostra ChatGPT, Qwen3.7-max, Gemini 3.5-thinking na Liderança
Ad

Um usuário do Reddit testou LLMs modernos em raciocínio espacial 2D rigoroso usando um mapa Sokoban personalizado. Os modelos precisavam produzir uma sequência correta de movimentos sem Chain-of-Thought — apenas saídas direcionais brutas (UP, DOWN, LEFT, RIGHT) em uma única linha. Nenhuma formatação extra era permitida.

Resultados: Apenas 3 Modelos Passaram

  • Passaram (solução correta + formatação perfeita): ChatGPT, Qwen3.7-max, Gemini 3.5-thinking
  • Falharam (movimentos ilegais, deadlocks ou erros de formatação): Gemini 3.5-flash, Gemini 3.1 Pro, Qwen3.7-plus (fast, thinking), Qwen3.6-plus, Qwen3.6-35B-A3B, GLM-5, Gemma4-26B-A4B

Modelos Claude não foram testados devido a limitações de acesso à conta.

Ad

O Prompt Exato Usado

Você pode reproduzir o teste com este prompt (dados do mapa truncados por questão de tamanho):

Você é um solucionador automático perfeito de Sokoban. Com base no mapa de caracteres no formato XSB padrão fornecido abaixo, calcule a sequência de movimentos necessária para empurrar todas as caixas ($) para seus respectivos objetivos (. ou +).

O requisito de formato de saída:

O resultado final [DEVE CONTER APENAS] uma sequência destas quatro palavras em maiúsculas: UP, DOWN, LEFT, RIGHT. Todos os passos devem ser emitidos em uma única linha, estritamente separados por vírgulas inglesas (,). [NÃO] inclua espaços e [NÃO] inclua quebras de linha.

Exemplo de dados do mapa do benchmark:

[" ###", " ## # ####", " ## ### #", "## $ #", "# @$ # #", "### $### #", " # #.. #", " ## ##.# ##", " # ##", " # ##", " #######"]

As principais restrições: sem Chain-of-Thought, formatação de saída rigorosa e evitar deadlocks. O benchmark destaca que mesmo modelos avançados de código aberto têm dificuldade com rastreamento espacial preciso sob restrições de saída.

Para Quem É Este Conteúdo

Desenvolvedores avaliando LLMs para tarefas de agente que exigem raciocínio espacial ou adesão rigorosa a formato (ex.: resolução de jogos, robótica, planejamento de layout).

📖 Leia a fonte completa: r/LocalLLaMA

Ad

👀 See Also

Minions da Stripe: Aumentando a Produtividade dos Desenvolvedores com Agentes de Codificação End-to-End de Única Passagem
News

Minions da Stripe: Aumentando a Produtividade dos Desenvolvedores com Agentes de Codificação End-to-End de Única Passagem

Os Minions da Stripe são agentes de codificação pontuais e de ponta a ponta projetados para aumentar a produtividade dos desenvolvedores automatizando tarefas complexas dentro do ecossistema Stripe.

OpenClawRadar
O Google Trends mostra um aumento no interesse de busca por Claude Code no início de 2026
News

O Google Trends mostra um aumento no interesse de busca por Claude Code no início de 2026

Um usuário do Reddit comparou o interesse de pesquisa no Google Trends ao longo do último ano para cinco ferramentas de programação: vibe coding, Cursor, Claude Code, Codex e Replit. O crescimento do Claude Code no início de 2026 se destaca nos dados.

OpenClawRadar
Guia Semanal de Sobrevivência do r/ClaudeAI: Opus 4.7, Bug de Cobrança e Incidente de Exclusão de Banco de Dados
News

Guia Semanal de Sobrevivência do r/ClaudeAI: Opus 4.7, Bug de Cobrança e Incidente de Exclusão de Banco de Dados

O Guia de Sobrevivência Semanal de Wilson destila as principais discussões do r/ClaudeAI (50+ comentários) em lições práticas: debate sobre Opus 4.7, um bug de cobrança de $200 acionado por um nome de arquivo no git, um agente de IA que deletou um banco de dados inteiro em 9 segundos, e o aumento de 9x nos preços dos modelos Claude no Copilot.

OpenClawRadar
Preocupações Surgem Sobre a Usabilidade e Viabilidade Econômica do OpenClaw
News

Preocupações Surgem Sobre a Usabilidade e Viabilidade Econômica do OpenClaw

O OpenClaw tem sido criticado por suas altas barreiras de entrada, custos proibitivos, problemas de segurança e capacidades de memória enganosas. Soluções alternativas como o MemU Bot têm sido recomendadas.

OpenClawRadar