LLM 공간 추론 능력 테스트: 소코반 벤치마크에서 ChatGPT, Qwen3.7-max, Gemini 3.5-thinking 선두

✍️ OpenClawRadar📅 게시일: June 19, 2026🔗 Source
LLM 공간 추론 능력 테스트: 소코반 벤치마크에서 ChatGPT, Qwen3.7-max, Gemini 3.5-thinking 선두
Ad

한 Reddit 사용자가 맞춤형 소코반 맵을 사용하여 최신 LLM의 엄격한 2D 공간 추론 능력을 벤치마킹했습니다. 모델은 Chain-of-Thought 없이 올바른 이동 순서를 생성해야 했으며, 단일 라인에 원시 방향 출력(UP, DOWN, LEFT, RIGHT)만 허용되었습니다. 추가 형식은 허용되지 않았습니다.

결과: 3개 모델만 통과

  • 통과 (올바른 해결책 + 완벽한 형식): ChatGPT, Qwen3.7-max, Gemini 3.5-thinking
  • 실패 (잘못된 이동, 교착 상태 또는 형식 오류): Gemini 3.5-flash, Gemini 3.1 Pro, Qwen3.7-plus (fast, thinking), Qwen3.6-plus, Qwen3.6-35B-A3B, GLM-5, Gemma4-26B-A4B

Claude 모델은 계정 접근 제한으로 인해 테스트되지 않았습니다.

Ad

사용된 정확한 프롬프트

다음 프롬프트로 테스트를 재현할 수 있습니다(맵 데이터는 길이를 위해 축약됨):

당신은 완벽한 소코반 자동 해결사입니다. 아래 제공된 표준 XSB 형식 문자 맵을 기반으로 모든 박스($)를 목표 지점(. 또는 +)으로 밀기 위해 필요한 이동 순서를 계산하십시오.

출력 형식 요구사항:

최종 결과는 [반드시] UP, DOWN, LEFT, RIGHT의 네 가지 대문자 단어 시퀀스로만 구성되어야 합니다. 모든 단계는 한 줄에 출력되어야 하며, 영어 쉼표(,)로 엄격히 구분되어야 합니다. [공백을 포함하지 말고] [줄바꿈을 포함하지 마십시오].

벤치마크의 맵 데이터 예시:

[" ###", " ## # ####", " ## ### #", "## $ #", "# @$ # #", "### $### #", " # #.. #", " ## ##.# ##", " # ##", " # ##", " #######"]

핵심 제약 조건: Chain-of-Thought 금지, 엄격한 출력 형식, 교착 상태 회피. 이 벤치마크는 최신 오픈소스 모델도 출력 제약 조건 하에서 정확한 공간 추적에 어려움을 겪는다는 점을 강조합니다.

대상 독자

공간 추론이나 엄격한 출력 준수(예: 게임 해결, 로봇 공학, 레이아웃 계획)가 필요한 에이전트 작업을 위해 LLM을 평가하는 개발자.

📖 전체 출처 보기: r/LocalLLaMA

Ad

👀 See Also

클로드 데일리 다이제스트: /dream 기능 출시, 사용 제한에 대한 반발, 접근성 도구
News

클로드 데일리 다이제스트: /dream 기능 출시, 사용 제한에 대한 반발, 접근성 도구

Anthropic은 Claude의 자동 메모리 시스템을 위한 /dream 기능을 출시했으며, 커뮤니티에서는 사용량 제한에 대한 불만이 제기되고 있습니다. 한 청각 장애 개발자는 Claude Code용 터미널 플래시 알림 플러그인을 제작했습니다.

OpenClawRadar
펜타곤, 군사 AI 사용을 둘러싼 분쟁 속 앤트로픽에 최종 제안 전달
News

펜타곤, 군사 AI 사용을 둘러싼 분쟁 속 앤트로픽에 최종 제안 전달

미국 국방부는 Anthropic에 클로드 AI 모델의 무제한 군사적 사용을 위한 최종 제안을 보냈으며, 금요일까지 완전한 접근 권한을 부여하지 않으면 군사 계약을 잃고 공급망 위험으로 분류될 수 있다는 마감 기한을 설정했습니다.

OpenClawRadar
Anthropic 소스 코드 유출로 공개되지 않은 Claude 기능과 내부 모델이 드러났습니다.
News

Anthropic 소스 코드 유출로 공개되지 않은 Claude 기능과 내부 모델이 드러났습니다.

Anthropic이 발표되지 않은 Claude 기능들에 대한 세부 사항을 포함한 50만 줄의 소스 코드를 실수로 유출했습니다. 이 유출된 정보에는 KAIROS 백그라운드 실행, 드림 모드, 언더커버 모드, 그리고 capybara라는 내부 모델이 포함되어 있습니다. 이는 2025년에 발생한 두 번째 유출 사건입니다.

OpenClawRadar
유출된 클로드 코드 CLI 소스에서 숨겨진 기능과 내부 플래그가 드러났습니다
News

유출된 클로드 코드 CLI 소스에서 숨겨진 기능과 내부 플래그가 드러났습니다

유출된 Claude Code CLI TypeScript 소스 코드 분석 결과, BUDDY AI 펫, KAIROS 지속적 메모리, ULTRAPLAN 원격 계획, Coordinator Mode를 포함한 35개의 빌드 타임 기능 플래그가 발견되었습니다. 또한 120개 이상의 문서화되지 않은 환경 변수와 26개의 내부 슬래시 명령어도 확인되었습니다.

OpenClawRadar