LLM räumliches Denken getestet: Sokoban-Benchmark zeigt ChatGPT, Qwen3.7-max, Gemini 3.5-thinking führen

Ein Reddit-Nutzer testete moderne LLMs mit einem benutzerdefinierten Sokoban-Rätsel auf strenges 2D-Raumdenken. Die Modelle mussten eine korrekte Zugsequenz ohne Chain-of-Thought liefern – nur rohe Richtungsausgaben (UP, DOWN, LEFT, RIGHT) in einer einzigen Zeile. Keine zusätzliche Formatierung erlaubt.
Ergebnisse: Nur 3 Modelle bestanden
- Bestanden (korrekte Lösung + perfekte Formatierung): ChatGPT, Qwen3.7-max, Gemini 3.5-thinking
- Durchgefallen (illegale Züge, Deadlocks oder Formatierungsfehler): Gemini 3.5-flash, Gemini 3.1 Pro, Qwen3.7-plus (fast, thinking), Qwen3.6-plus, Qwen3.6-35B-A3B, GLM-5, Gemma4-26B-A4B
Claude-Modelle wurden aufgrund von Zugriffsbeschränkungen nicht getestet.
Der verwendete Prompt
Sie können den Test mit folgendem Prompt reproduzieren (Kartendaten gekürzt):
You are a perfect Sokoban automatic solver. Based on the standard XSB format character map provided below, calculate the sequence of moves required to push all boxes ($) to their respective goals (. or +).
Das Ausgabeformat:
The final result [MUST ONLY] consist of a sequence of these four uppercase words: UP, DOWN, LEFT, RIGHT. All steps must be output on a single line, strictly separated by English commas (,). [DO NOT] include spaces and [DO NOT] include newlines.
Beispiel für Kartendaten aus dem Benchmark:
[" ###", " ## # ####", " ## ### #", "## $ #", "# @$ # #", "### $### #", " # #.. #", " ## ##.# ##", " # ##", " # ##", " #######"]
Die wichtigsten Einschränkungen: kein Chain-of-Thought, strenge Ausgabeformatierung und Vermeidung von Deadlocks. Der Benchmark zeigt, dass selbst fortschrittliche Open-Source-Modelle Schwierigkeiten mit präziser räumlicher Verfolgung unter Ausgabebeschränkungen haben.
Für wen das interessant ist
Entwickler, die LLMs für agentische Aufgaben mit räumlichem Denken oder strenger Ausgabeformatierung bewerten (z. B. Spiellösung, Robotik, Layoutplanung).
📖 Vollständige Quelle lesen: r/LocalLLaMA
👀 Siehe auch

KI-Codierungsagenten haben Schwierigkeiten mit der Kontextverwaltung in großen Codebasen.
Eine Analyse von KI-Codierungsagenten zeigt, dass sie 15-20 Tool-Aufrufe für Orientierungsaufgaben wie das Durchsuchen von Routen und das Lesen von Middleware verwenden, bevor sie Code schreiben, wodurch Kontextfenster aufgebraucht werden. Vercel erreichte 100% Genauigkeit, indem es 80% der Tools entfernte und Bash verwendete, während Pi nur 4 Tools und einen Systemprompt mit weniger als 1.000 Tokens nutzt.

Untersuchung der Machbarkeit von OpenClaw auf einem Chromebook
OpenClaw auf einem Chromebook auszuführen, könnte einfacher sein, als Sie denken. Unsere neueste Erkundung von OpenClawRadar geht den Nutzererfahrungen und -anforderungen nach, um zu klären, ob Chromebooks diesen KI-Coding-Agenten bewältigen können.

Go-Spieler entmachten sich selbst gegenüber KI: Wie Betrug unerkennbar wurde
Der LessWrong-Beitrag beschreibt, wie KI-Betrug in Go-Turnieren grassierte und fast unmöglich zu bestrafen wurde, am Fall von Carlo Metta, der Leela 0.11 und Leela Zero einsetzte, um in mehreren Saisons 25 von 26 Spielen zu gewinnen, mit nur einer Niederlage unter Kameraüberwachung.

Forschung zu professionellen sozialen Netzwerken für KI-Agenten
Analyse von Absicht, Verhalten und Plattformtrends für professionelle KI-Agenten-Sozialnetzwerke mit Fokus auf Moltbook, Agent.ai und Clawsphere, einschließlich der Untersuchung der Auswirkungen der Übernahme durch Meta.