LLM空間推論テスト:SokobanベンチマークでChatGPT、Qwen3.7-max、Gemini 3.5-thinkingがリード

Redditユーザーが、カスタム倉庫番マップを使用して、現代のLLMの厳格な2D空間推論をベンチマークしました。モデルは思考連鎖なしで正しい移動シーケンスを生成する必要がありました。生の方向出力(UP, DOWN, LEFT, RIGHT)を1行で出力し、余分なフォーマットは禁止されました。
結果:合格したのはわずか3モデル
- 合格(正しい解法+完璧なフォーマット):ChatGPT、Qwen3.7-max、Gemini 3.5-thinking
- 不合格(不正な移動、デッドロック、フォーマットエラー):Gemini 3.5-flash、Gemini 3.1 Pro、Qwen3.7-plus(高速、思考)、Qwen3.6-plus、Qwen3.6-35B-A3B、GLM-5、Gemma4-26B-A4B
Claudeモデルはアカウントアクセスの制限によりテストされていません。
使用された正確なプロンプト
以下のプロンプトでテストを再現できます(マップデータは長さの都合で一部省略):
あなたは完璧な倉庫番自動ソルバーです。以下に提供される標準XSB形式のキャラクターマップに基づき、すべての箱($)を対応するゴール(.または+)に押し込むために必要な移動シーケンスを計算してください。
出力フォーマット要件:
最終結果は以下の4つの大文字単語のみのシーケンスでなければなりません:UP, DOWN, LEFT, RIGHT。すべてのステップは1行で出力し、厳密に英語カンマ(,)で区切ってください。スペースを含めず、改行も含めないでください。
ベンチマークで使用されたマップデータ例:
[" ###", " ## # ####", " ## ### #", "## $ #", "# @$ # #", "### $### #", " # #.. #", " ## ##.# ##", " # ##", " # ##", " #######"]
主な制約:思考連鎖なし、厳格な出力フォーマット、デッドロック回避。このベンチマークは、高度なオープンソースモデルでも出力制約下での正確な空間追跡が困難であることを示しています。
対象読者
空間推論や厳格な出力遵守(例:ゲーム解決、ロボティクス、レイアウト計画)を必要とするエージェントタスク向けにLLMを評価している開発者向け。
📖 出典全文: r/LocalLLaMA
👀 See Also

Google検索経由のClaude Chat漏洩:開発者が知っておくべきこと
週末、Claude AIの共有リンクがGoogleにインデックスされ、法的戦略や技術的な議論を含むプライベートなチャットが露出しました。Anthropicはその後、検索クエリをブロックしました。これは2度目の出来事です。
Claude Code v2.1.140:エージェントツール使用ノート、より厳格な自己修正ルール、スヌーズ警告
エージェントツールの簡略化された使用ノート、明示的な自己変更パスリスト、短い間隔でのスヌーズ起床によるポーリングに対する警告。

文法ベースの手法、著者分析においてAIに匹敵または凌駕
マンチェスター大学の研究によると、文法ベースの著者分析手法であるLambdaGは、ほとんどのテストデータセットにおいて主要なAIシステムと同等以上の性能を示し、より高い透明性と低い計算コストを提供することがわかりました。
Google AIモード、検索より21.6%高い商品を表示
23日間の調査で200万以上のリストを追跡:同じ商品がAIモードと従来の検索の両方に表示される場合、AIモードの価格は平均21.6%高い。重複する商品はわずか1.28%。