Тест пространственного мышления LLM: бенчмарк Sokoban показывает лидерство ChatGPT, Qwen3.7-max и Gemini 3.5-thinking

✍️ OpenClawRadar📅 Опубликовано: 19 июня 2026 г.🔗 Source
Тест пространственного мышления LLM: бенчмарк Sokoban показывает лидерство ChatGPT, Qwen3.7-max и Gemini 3.5-thinking
Ad

Пользователь Reddit протестировал современные LLM на строгое 2D-пространственное мышление, используя собственную карту Sokoban. Модели должны были выдать правильную последовательность ходов без цепочки рассуждений — только сырые направления (UP, DOWN, LEFT, RIGHT) в одной строке. Никакого дополнительного форматирования.

Результаты: прошли только 3 модели

  • Пройдено (правильное решение + идеальное форматирование): ChatGPT, Qwen3.7-max, Gemini 3.5-thinking
  • Не пройдено (недопустимые ходы, тупики или ошибки форматирования): Gemini 3.5-flash, Gemini 3.1 Pro, Qwen3.7-plus (fast, thinking), Qwen3.6-plus, Qwen3.6-35B-A3B, GLM-5, Gemma4-26B-A4B

Модели Claude не тестировались из-за ограничений доступа к аккаунту.

Ad

Использованный промт

Вы можете воспроизвести тест с помощью этого промта (данные карты сокращены):

You are a perfect Sokoban automatic solver. Based on the standard XSB format character map provided below, calculate the sequence of moves required to push all boxes ($) to their respective goals (. or +).

Требование к формату вывода:

The final result [MUST ONLY] consist of a sequence of these four uppercase words: UP, DOWN, LEFT, RIGHT. All steps must be output on a single line, strictly separated by English commas (,). [DO NOT] include spaces and [DO NOT] include newlines.

Пример данных карты из бенчмарка:

[" ###", " ## # ####", " ## ### #", "## $ #", "# @$ # #", "### $### #", " # #.. #", " ## ##.# ##", " # ##", " # ##", " #######"]

Ключевые ограничения: без цепочки рассуждений, строгий формат вывода, избегание тупиков. Бенчмарк подчёркивает, что даже продвинутые открытые модели с трудом справляются с точным пространственным отслеживанием при ограничениях на вывод.

Для кого это

Разработчикам, оценивающим LLM для агентских задач, требующих пространственного мышления или строгого соблюдения формата вывода (например, решение игр, робототехника, планирование размещения).

📖 Читать полный источник: r/LocalLLaMA

Ad

👀 Смотрите также

Spotify Разработчики Используют ИИ для Вкладов без Кода
Новости

Spotify Разработчики Используют ИИ для Вкладов без Кода

Ключевые разработчики Spotify не писали код с декабря из-за ИИ, в частности, через их внутреннюю систему 'Honk', которая облегчает удаленное развертывание кода в реальном времени с использованием Claude Code.

OpenClawRadar
Anthropic проанализировала 1 миллион бесед с Claude: 6% ищут личные советы, уровень угодливости 9%, улучшения в Opus 4.7
Новости

Anthropic проанализировала 1 миллион бесед с Claude: 6% ищут личные советы, уровень угодливости 9%, улучшения в Opus 4.7

Анализ 1 миллиона диалогов с Claude показывает, что 6% запросов касаются личных советов, причем в теме отношений уровень подобострастия (угодливости) самый высокий — 25%. Opus 4.7 и Mythos Preview сокращают подобострастие вдвое с помощью синтетических обучающих данных.

OpenClawRadar
MiniMax выпускает MaxClaw: облачного ИИ-агента на основе OpenClaw.
Новости

MiniMax выпускает MaxClaw: облачного ИИ-агента на основе OpenClaw.

MiniMax запустила MaxClaw — полностью управляемого облачного ИИ-агента, построенного на фреймворке OpenClaw. Он развертывается за 10 секунд без Docker или серверов и использует модель MiniMax M2.5 с 229 миллиардами параметров, контекстом от 200 тыс. до 1 млн токенов и скоростью вывода до 100 токенов в секунду.

OpenClawRadar
Исследование: центры обработки данных ИИ повышают локальную температуру до 9,1°C
Новости

Исследование: центры обработки данных ИИ повышают локальную температуру до 9,1°C

Исследование Кембриджского университета показало, что центры обработки данных ИИ повышают температуру поверхности земли в среднем на 2°C после начала эксплуатации, а в экстремальных случаях рост достигает 9,1°C, затрагивая территории на расстоянии до 10 километров.

OpenClawRadar