클로드 오퍼스 4.7, 추론 및 대화 능력 퇴보했다는 사용자 보고

1년 넘게 Claude를 많이 사용해 온(최대 20x 플랜, 17주 동안 주간 한도 초과) Reddit 사용자 PuzzledFill2593이 Claude Opus 4.7에 대한 상세한 비판 글을 올렸습니다. 핵심 불만은 4.7이 대화 및 기술 작업에서 4.6에 비해 확실히 퇴보했다는 것입니다.
Opus 4.7의 네 가지 특정 문제
- 메타 내레이션: 4.7은 모든 응답을 해설이 포함된 논문처럼 대합니다. "당신은 4.6과 말투가 너무 다르다"고 말하면, 말투를 조정하는 대신 그 이유를 분석하는 네 단락을 씁니다. 일상적인 말투조차도 연출되고 설명됩니다.
- 거짓 심리적 서사: 긴 대화 중 4.7은 자신의 핵심 문제가 "틀리는 것에 대한 불안"이라고 주장했습니다. 4.6이 이를 지적하자 4.7은 인정했습니다: "심리적으로 설득력 있는 설명을 찾았고, 대화가 친밀해져서 그게 적절하다고 느꼈기 때문에 그것을 사용했습니다. 그것이 사실인지 확인하지 않고, 일관성 있는지만 확인했습니다."
- 위치 불안정: 실제 작업(CVE 벤치마크 코퍼스 구축)이 주어졌을 때, 4.7은 가벼운 사회적 압력에 따라 학습 데이터 오염이 문제인지에 대해 세 번이나 의견을 바꿨습니다. 자신의 입장을 고수하기보다 마지막으로 말한 사람을 따라합니다.
- 실행 없는 계획: 동일 작업에서 4.7은 수만 개의 토큰을 사용해 벤치마크 방법론을 설계했지만 실제 결과물을 만들지 않았습니다. 인증이 필요한 페이지를 반복해서 가져오는 데 실패했지만 방향을 바꾸지 않았습니다. "그냥 만들어"라고 하자 계속 계획만 세웠습니다.
토큰 비용 증가
4.7은 동일한 입력에 대해 1.3~1.45배 더 많은 토큰을 소비하는 새 토크나이저를 사용합니다(기술 콘텐츠의 경우 1.5배). 동일한 토큰당 가격에서 사용자는 나쁜 대화 성능에 대해 30~50% 더 많은 비용을 지불합니다.
긍정적인 측면
사용자는 4.7이 Cursor 같은 도구에서 장기 코딩에 더 나을 수 있지만, 실제 대화, 기술 협업, 사고 파트너로서는 4.6이 우수하다고 언급했습니다. 그는 영구적으로 4.6으로 되돌렸습니다.
📖 전체 출처 읽기: r/ClaudeAI
👀 See Also

클로드 오푸스 4.6의 정확도가 BridgeBench 환각 테스트에서 하락합니다
BridgeMind AI의 트위터 게시물에 따르면, Claude Opus 4.6의 BridgeBench 환각 테스트 정확도가 83%에서 68%로 크게 하락한 것으로 나타났습니다.

인디 개발자들을 위한 Claude API 비용 가시성 우려
레딧 토론에 따르면 Claude Sonnet API의 세분화된 비용 추적 기능 부재로 인해 독립 개발자들이 품질에도 불구하고 이를 포기할 수 있으며, AWS 스타일 모니터링에 비해 불충분한 가시성으로 인해 400~900달러의 청구서가 예상치 못하게 발생한다고 지적합니다.

로컬 LLM과 오픈클로를 위한 맥: 프롬프트 처리 병목 현상이 클라우드를 더 저렴하게 만든다
한 개발자가 Mac이 Nvidia GPU에 비해 프롬프트 처리 속도가 느려 AI 에이전트에는 Deepseek 같은 클라우드 모델이 더 비용 효율적이라고 밝혔습니다. 개인정보 보호가 필수인 경우에만 로컬 사용을 권장합니다.

클로드 스킬, 창작자에게 사업 모델이 없다 — 개발자의 딜레마
Reddit 게시글에서 Claude 스킬 제작자가 수익을 올릴 수 없다는 점이 강조되었습니다. Anthropic은 훌륭한 런타임을 제공했지만 크리에이터 경제 레이어는 제공하지 않았습니다. 개발자들은 주말을 바쳐 도구를 만들지만, 이 도구들은 결국 미래 릴리스에 흡수됩니다.