LLM 공간 추론 능력 테스트: 소코반 벤치마크에서 ChatGPT, Qwen3.7-max, Gemini 3.5-thinking 선두

한 Reddit 사용자가 맞춤형 소코반 맵을 사용하여 최신 LLM의 엄격한 2D 공간 추론 능력을 벤치마킹했습니다. 모델은 Chain-of-Thought 없이 올바른 이동 순서를 생성해야 했으며, 단일 라인에 원시 방향 출력(UP, DOWN, LEFT, RIGHT)만 허용되었습니다. 추가 형식은 허용되지 않았습니다.
결과: 3개 모델만 통과
- 통과 (올바른 해결책 + 완벽한 형식): ChatGPT, Qwen3.7-max, Gemini 3.5-thinking
- 실패 (잘못된 이동, 교착 상태 또는 형식 오류): Gemini 3.5-flash, Gemini 3.1 Pro, Qwen3.7-plus (fast, thinking), Qwen3.6-plus, Qwen3.6-35B-A3B, GLM-5, Gemma4-26B-A4B
Claude 모델은 계정 접근 제한으로 인해 테스트되지 않았습니다.
사용된 정확한 프롬프트
다음 프롬프트로 테스트를 재현할 수 있습니다(맵 데이터는 길이를 위해 축약됨):
당신은 완벽한 소코반 자동 해결사입니다. 아래 제공된 표준 XSB 형식 문자 맵을 기반으로 모든 박스($)를 목표 지점(. 또는 +)으로 밀기 위해 필요한 이동 순서를 계산하십시오.
출력 형식 요구사항:
최종 결과는 [반드시] UP, DOWN, LEFT, RIGHT의 네 가지 대문자 단어 시퀀스로만 구성되어야 합니다. 모든 단계는 한 줄에 출력되어야 하며, 영어 쉼표(,)로 엄격히 구분되어야 합니다. [공백을 포함하지 말고] [줄바꿈을 포함하지 마십시오].
벤치마크의 맵 데이터 예시:
[" ###", " ## # ####", " ## ### #", "## $ #", "# @$ # #", "### $### #", " # #.. #", " ## ##.# ##", " # ##", " # ##", " #######"]
핵심 제약 조건: Chain-of-Thought 금지, 엄격한 출력 형식, 교착 상태 회피. 이 벤치마크는 최신 오픈소스 모델도 출력 제약 조건 하에서 정확한 공간 추적에 어려움을 겪는다는 점을 강조합니다.
대상 독자
공간 추론이나 엄격한 출력 준수(예: 게임 해결, 로봇 공학, 레이아웃 계획)가 필요한 에이전트 작업을 위해 LLM을 평가하는 개발자.
📖 전체 출처 보기: r/LocalLLaMA
👀 See Also

Claude Code v2.1.146: /code-review 명령, 페이지네이션 수정, Windows PowerShell 수정
Claude Code v2.1.146에서는 /simplify가 /code-review로 변경되어 선택적 노력 수준을 지원하며, MCP 페이지네이션과 Windows PowerShell 도구가 수정되었고, 자동 업데이터 신뢰성과 대규모 편집에 대한 diff 렌더링 성능이 개선되었습니다.

7개국에서의 Claude 앱 스토어 순위
클로드는 2026년 3월 1일 09:00 UTC에 동시에 캡처된 App Store 무료 앱 순위에서 미국과 캐나다에서 1위, 프랑스와 독일에서 3위, 영국에서 4위, 이탈리아에서 8위, 일본에서 22위를 기록했습니다.

Gemma 4 대 Qwen 3.5 블라인드 평가 결과 (Claude Opus 심사위원)
30개 질문에 대한 블라인드 평가에서 Claude Opus 4.6을 심사위원으로 사용해 Gemma 4 31B, Gemma 4 26B-A4B, Qwen 3.5 27B를 비교했습니다. Qwen 3.5 27B는 46.7%의 대결에서 승리했지만, 세 번의 0점 응답으로 인해 평균 점수는 더 낮았습니다.

Gemma 4 출시: 로컬 AI 호스팅을 위한 4가지 모델 크기
Google은 엣지 디바이스, 노트북, GPU 등 다양한 하드웨어에 최적화된 4가지 모델 크기의 Gemma 4를 출시했습니다. 모든 모델은 텍스트와 비전 기능을 갖춘 멀티모달이며, 소형 모델은 실시간 오디오를 지원합니다.