Opus 4.6 확장 사고 방식은 물리학 다이어그램 문제에서 더 낮은 성능을 보입니다

✍️ OpenClawRadar📅 게시일: April 17, 2026🔗 Source
Opus 4.6 확장 사고 방식은 물리학 다이어그램 문제에서 더 낮은 성능을 보입니다
Ad

확장 사고 모드의 성능 문제

r/ClaudeAI의 한 사용자가 시각적 다이어그램 해석이 필요한 물리학 문제에 대해 Opus 4.6과 Gemini 3.1 Pro를 테스트한 결과를 보고했습니다. 테스트 결과, 확장 사고 모드를 사용할 때 Opus 4.6에서 특정 성능 저하가 나타났습니다.

테스트의 주요 발견점

  • 테스트 범위: "문제의 상당 부분이 시나리오를 보여주는 시각적 다이어그램을 해석하는 것"인 5개의 물리학 문제
  • 확장 사고 모드 사용 시 Opus 4.6: "다이어그램의 근본적인 오해로 인해" 5개 문제 모두 "완전히 틀림"
  • Gemini 3.1 Pro: 5개 문제 모두 "완벽하게 해결"
  • 확장 사고 모드 미사용 시 Opus 4.6: 문제를 성공적으로 해결했으며 "훨씬 더 빠르기도 했음"

사용자는 확장 사고가 일반적으로 성능을 향상시키지만, 이 특정 다이어그램 해석 사례에서는 일관된 실패를 초래했다는 점을 "정말 이상한 행동"이라고 설명했습니다.

📖 Read the full source: r/ClaudeAI

Ad

👀 See Also

Anthropic, Claude 구독 한도에서 타사 하네스 차단, 우회 방법 존재
News

Anthropic, Claude 구독 한도에서 타사 하네스 차단, 우회 방법 존재

Anthropic이 Claude 구독 한도에 대한 제3자 하네스 접근을 제한하여, 이러한 도구에 의존하는 워크플로우를 방해할 가능성이 있습니다. 한 Reddit 사용자는 몇 달 동안의 훈련 데이터를 거의 잃을 뻔한 후 오픈소스 해결책을 개발했다고 보고했습니다.

OpenClawRadar
Terry Tao가 말하는 AI 증명 검사기: Lean, 협업, 공식 수학
News

Terry Tao가 말하는 AI 증명 검사기: Lean, 협업, 공식 수학

테리 타오는 수학자들이 수백 명이 협력하고, 인간이 아닌 Lean 같은 컴퓨터가 증명을 검증할 것이라고 예측합니다. Quanta Magazine의 발췌문이 이 비전을 탐구합니다.

OpenClawRadar
블룸버그 보도, AI 노출로 인한 미국 일자리 손실 증가 시작
News

블룸버그 보도, AI 노출로 인한 미국 일자리 손실 증가 시작

블룸버그는 AI에 노출된 직종에서 미국의 일자리 손실이 심각하다고 보도했으며, Hacker News 토론에서는 개발자와 기타 지식 근로자에 대한 실제 영향을 지목하고 있습니다.

OpenClawRadar
MCP 대 스킬 논쟁: 역할 이해와 컨텍스트 부패의 실제 문제
News

MCP 대 스킬 논쟁: 역할 이해와 컨텍스트 부패의 실제 문제

레딧 게시물에 따르면 MCP는 AI 에이전트를 위한 도구, 인증, 컨텍스트 조정을 제공하는 반면, 스킬은 에이전트 행동을 정의하는 재사용 가능한 프롬프트입니다. 저자는 두 가지가 모두 필요하며, 에이전트가 지시를 잊어버리는 '컨텍스트 부패'가 중요한 문제라고 지적합니다.

OpenClawRadar