LLM räumliches Denken getestet: Sokoban-Benchmark zeigt ChatGPT, Qwen3.7-max, Gemini 3.5-thinking führen

Ein Reddit-Nutzer testete moderne LLMs mit einem benutzerdefinierten Sokoban-Rätsel auf strenges 2D-Raumdenken. Die Modelle mussten eine korrekte Zugsequenz ohne Chain-of-Thought liefern – nur rohe Richtungsausgaben (UP, DOWN, LEFT, RIGHT) in einer einzigen Zeile. Keine zusätzliche Formatierung erlaubt.
Ergebnisse: Nur 3 Modelle bestanden
- Bestanden (korrekte Lösung + perfekte Formatierung): ChatGPT, Qwen3.7-max, Gemini 3.5-thinking
- Durchgefallen (illegale Züge, Deadlocks oder Formatierungsfehler): Gemini 3.5-flash, Gemini 3.1 Pro, Qwen3.7-plus (fast, thinking), Qwen3.6-plus, Qwen3.6-35B-A3B, GLM-5, Gemma4-26B-A4B
Claude-Modelle wurden aufgrund von Zugriffsbeschränkungen nicht getestet.
Der verwendete Prompt
Sie können den Test mit folgendem Prompt reproduzieren (Kartendaten gekürzt):
You are a perfect Sokoban automatic solver. Based on the standard XSB format character map provided below, calculate the sequence of moves required to push all boxes ($) to their respective goals (. or +).
Das Ausgabeformat:
The final result [MUST ONLY] consist of a sequence of these four uppercase words: UP, DOWN, LEFT, RIGHT. All steps must be output on a single line, strictly separated by English commas (,). [DO NOT] include spaces and [DO NOT] include newlines.
Beispiel für Kartendaten aus dem Benchmark:
[" ###", " ## # ####", " ## ### #", "## $ #", "# @$ # #", "### $### #", " # #.. #", " ## ##.# ##", " # ##", " # ##", " #######"]
Die wichtigsten Einschränkungen: kein Chain-of-Thought, strenge Ausgabeformatierung und Vermeidung von Deadlocks. Der Benchmark zeigt, dass selbst fortschrittliche Open-Source-Modelle Schwierigkeiten mit präziser räumlicher Verfolgung unter Ausgabebeschränkungen haben.
Für wen das interessant ist
Entwickler, die LLMs für agentische Aufgaben mit räumlichem Denken oder strenger Ausgabeformatierung bewerten (z. B. Spiellösung, Robotik, Layoutplanung).
📖 Vollständige Quelle lesen: r/LocalLLaMA
👀 Siehe auch

Kognitive Schulden: Wenn KI-Ausgabe das Verständnis überholt
Ein Reddit-Beitrag behandelt die 'kognitive Schuld' – die Lücke zwischen KI-generierter Ausgabe und dem Verständnis des Teams – und argumentiert, dass kreative Kontrolle bedeutet, zu wissen, was man ausgeliefert hat. Der Beitrag selbst wurde mit Claudes Hilfe verfasst, was die Ironie der Situation meta-kommentiert.

Claude Opus 4.7 markiert Hantavirus-Impfstoff-Fragen als Sicherheitsrisiko und stoppt Chats
Wenn man Claude Opus 4.7 fragt, wie man einen Hantavirus-Impfstoff entwickelt, löst das Sicherheitsfilter aus, die den Chat pausieren, während Sonnet 4.6 ebenfalls ähnliche prädiktive Modellierung blockiert.

inclusionAI veröffentlicht Ling-2.6-1T: Hybridarchitektur-Modell mit Billionen Parametern, Sparse Attention und schnellem Denken
Ling-2.6-1T ist ein neues Open-Source-Modell mit einer Billion Parametern, das MLA und Linear Attention für Effizienz bei langen Kontexten kombiniert und mittels Contextual Process Redundancy Suppression wortreiche Gedankenketten reduziert. Erzielt Open-Source-Spitzenwerte bei AIME26, SWE-bench Verified, BFCL-V4, TAU2-Bench und IFBench.

PostmarketOS Februar-Update 2026: Generische Kernel und KI-Richtlinie
PostmarketOS bietet nun generische Kernel-Pakete (linux-postmarketos-mainline, -stable, -lts) an und hat seine KI-Richtlinie aktualisiert, um generative KI ausdrücklich zu verbieten. Das Projekt verzeichnete auch Änderungen bei den Mitwirkenden und Verbesserungen bei der Hardware-CI.