Prueba de razonamiento espacial de LLM: el benchmark Sokoban muestra que ChatGPT, Qwen3.7-max y Gemini 3.5-thinking lideran

Un usuario de Reddit evaluó LLMs modernos en razonamiento espacial 2D estricto usando un mapa personalizado de Sokoban. Los modelos debían producir una secuencia correcta de movimientos sin Cadena de Pensamiento — solo salidas direccionales crudas (UP, DOWN, LEFT, RIGHT) en una sola línea. Sin formato adicional permitido.
Resultados: Solo 3 Modelos Pasaron
- Aprobados (solución correcta + formato perfecto): ChatGPT, Qwen3.7-max, Gemini 3.5-thinking
- Fallaron (movimientos ilegales, bloqueos o errores de formato): Gemini 3.5-flash, Gemini 3.1 Pro, Qwen3.7-plus (rápido, pensamiento), Qwen3.6-plus, Qwen3.6-35B-A3B, GLM-5, Gemma4-26B-A4B
Los modelos Claude no se probaron debido a limitaciones de acceso a la cuenta.
El Prompt Exacto Usado
Puedes reproducir la prueba con este prompt (datos del mapa recortados por longitud):
You are a perfect Sokoban automatic solver. Based on the standard XSB format character map provided below, calculate the sequence of moves required to push all boxes ($) to their respective goals (. or +).
El requisito de formato de salida:
The final result [MUST ONLY] consist of a sequence of these four uppercase words: UP, DOWN, LEFT, RIGHT. All steps must be output on a single line, strictly separated by English commas (,). [DO NOT] include spaces and [DO NOT] include newlines.
Ejemplo de datos del mapa del benchmark:
[" ###", " ## # ####", " ## ### #", "## $ #", "# @$ # #", "### $### #", " # #.. #", " ## ##.# ##", " # ##", " # ##", " #######"]
Las restricciones clave: sin Cadena de Pensamiento, formato de salida estricto y evitar bloqueos. El benchmark destaca que incluso los modelos avanzados de código abierto tienen dificultades con el seguimiento espacial preciso bajo restricciones de salida.
Para Quién Es Esto
Desarrolladores que evalúan LLMs para tareas agentivas que requieren razonamiento espacial o adherencia estricta a la salida (por ejemplo, resolución de juegos, robótica, planificación de diseños).
📖 Leer la fuente completa: r/LocalLLaMA
👀 Ver también

Bonsai 27B: Primer modelo de clase 27B funciona en un teléfono — Puntuaciones de referencia y especificaciones
PrismML lanza Bonsai 27B, un modelo ternario/binario de 27B parámetros que ocupa 3.9-5.9 GB y funciona en teléfonos y laptops. Retiene el 90-95% del rendimiento de la línea base de precisión completa.

Claude Code v2.1.163: Fijación de Versión, Lista de Plugins, Mejoras en Hooks y Correcciones Críticas de Errores
Claude Code v2.1.163 añade requiredMinimumVersion/requiredMaximumVersion en ajustes gestionados, el comando /plugin list, mejoras en el contexto de hooks y correcciones para cuelgues de claude -p, EEXIST en Windows y la regresión de Bazel/EDR.

El tráfico del subreddit r/ClaudeAI se dispara de 500.000 a 1,9 millones de visitantes semanales
El subreddit r/ClaudeAI creció de aproximadamente 250.000 visitantes semanales en noviembre de 2025 a 1,9 millones en marzo de 2026, manteniéndose el número de suscriptores en torno a 85.000 usuarios.
Claude Code v2.1.247: Herramienta SendFeedback, optimizador de costos y más de 20 correcciones de errores
Claude Code v2.1.247 añade una herramienta SendFeedback, un comando /claude-api cost-optimize, y corrige más de 20 errores, incluidos el fallback de subagentes y problemas de distribución del teclado.