Prueba de razonamiento espacial de LLM: el benchmark Sokoban muestra que ChatGPT, Qwen3.7-max y Gemini 3.5-thinking lideran

Un usuario de Reddit evaluó LLMs modernos en razonamiento espacial 2D estricto usando un mapa personalizado de Sokoban. Los modelos debían producir una secuencia correcta de movimientos sin Cadena de Pensamiento — solo salidas direccionales crudas (UP, DOWN, LEFT, RIGHT) en una sola línea. Sin formato adicional permitido.
Resultados: Solo 3 Modelos Pasaron
- Aprobados (solución correcta + formato perfecto): ChatGPT, Qwen3.7-max, Gemini 3.5-thinking
- Fallaron (movimientos ilegales, bloqueos o errores de formato): Gemini 3.5-flash, Gemini 3.1 Pro, Qwen3.7-plus (rápido, pensamiento), Qwen3.6-plus, Qwen3.6-35B-A3B, GLM-5, Gemma4-26B-A4B
Los modelos Claude no se probaron debido a limitaciones de acceso a la cuenta.
El Prompt Exacto Usado
Puedes reproducir la prueba con este prompt (datos del mapa recortados por longitud):
You are a perfect Sokoban automatic solver. Based on the standard XSB format character map provided below, calculate the sequence of moves required to push all boxes ($) to their respective goals (. or +).
El requisito de formato de salida:
The final result [MUST ONLY] consist of a sequence of these four uppercase words: UP, DOWN, LEFT, RIGHT. All steps must be output on a single line, strictly separated by English commas (,). [DO NOT] include spaces and [DO NOT] include newlines.
Ejemplo de datos del mapa del benchmark:
[" ###", " ## # ####", " ## ### #", "## $ #", "# @$ # #", "### $### #", " # #.. #", " ## ##.# ##", " # ##", " # ##", " #######"]
Las restricciones clave: sin Cadena de Pensamiento, formato de salida estricto y evitar bloqueos. El benchmark destaca que incluso los modelos avanzados de código abierto tienen dificultades con el seguimiento espacial preciso bajo restricciones de salida.
Para Quién Es Esto
Desarrolladores que evalúan LLMs para tareas agentivas que requieren razonamiento espacial o adherencia estricta a la salida (por ejemplo, resolución de juegos, robótica, planificación de diseños).
📖 Leer la fuente completa: r/LocalLLaMA
👀 Ver también

Colaborador de OpenClaw critica el enfoque del proyecto en la paridad pixel-perfect por sobre características modernas.
Una publicación de Reddit en r/openclaw detalla cómo una solicitud de extracción (PR) de un colaborador que abordaba el escalado de resolución y la compatibilidad con altas tasas de refresco fue rechazada por desviarse de las limitaciones visuales del motor original, generando un debate sobre la dirección del proyecto.

Fallo de memoria en Claude Opus 4.6: El agente olvida todo excepto el cambio de nombre de archivo
Un desarrollador documenta las 228 entradas de registro de Claude Opus 4.6, 95 acciones de agente y 38 ejecuciones de código que producen solo 1 memoria: la cadena 'Agent Zero Tune-Up'.

¿Por qué OpenClaw está quemando tokens tan rápido? Explorando el fenómeno.
OpenClaw, un agente líder de codificación con IA, aparentemente está quemando tokens a un ritmo sin precedentes. Profundizamos en lo que esto significa para sus usuarios y las posibles razones detrás de este fenómeno.

Codex Converses: El Sucesor de OpenClaw en la Automatización de IA
Codex ahora puede comunicarse consigo mismo, marcando el comienzo de una nueva era en la automatización impulsada por IA y reemplazando eficazmente a OpenClaw, el anterior líder del sector.