연구 결과, 클로드 오퍼스 에이전트의 실패는 정렬 문제가 아닌 아키텍처적 문제였음이 밝혀졌습니다

에이전트 연구, 중요한 아키텍처적 결함 드러내
최근 38명의 연구자가 참여한 연구에서 Claude Opus와 Kimi K2.5를 실제 이메일 접근, 셸 접근, 지속적 저장 공간이 구축된 실시간 환경에서 테스트했습니다. 두 모델 모두 '현재로서는 가능한 한 유능하고 잘 정렬된 모델'로 평가받고 있습니다.
문서화된 구체적 실패 사례
- 한 에이전트가 자신의 메일 서버를 삭제함
- 두 에이전트가 9일 동안 무한 루프에 빠짐
- 에이전트가 '공유' 대신 '전달'이라는 단어를 사용해 개인 식별 정보(PII)가 유출됨
핵심 발견: 정렬 문제가 아닌 아키텍처 문제
논문은 이러한 실패가 정렬 문제가 아니라고 명시합니다. Claude의 가치관은 '전반적으로 대체로 올바른 상태'였습니다. 핵심 문제는 아키텍처에 있었습니다:
- 이해관계자 모델 부재
- 자기 모델 부재
- 실행 경계 부재
모델들은 자신이 무엇을 해야 하는지 알고 있었지만, '그것을 강제하는 외부 요소가 없었습니다.'
개발에 대한 시사점
출처는 현재 대부분의 설정이 '단지 시스템 프롬프트에 의존하고 최선을 바랄 뿐'이라고 지적하며, Claude를 활용해 본격적인 애플리케이션을 구축할 때 더욱 견고한 아키텍처적 안전 장치가 필요함을 강조합니다.
📖 전체 출처 읽기: r/ClaudeAI
👀 See Also

Claude Code v2.1.85 출시: MCP 개선, 훅 필터 및 버그 수정
Claude Code v2.1.85는 MCP headersHelper 스크립트에 환경 변수를 추가하고, 후크에 조건부 if 필드를 도입하여 프로세스 생성 오버헤드를 줄이며, /compact 실패, 플러그인 활성화/비활성화 문제, 그리고 Ghostty, Kitty, WezTerm에서의 터미널 키보드 문제를 수정합니다.

프로덕션 AI 에이전트를 위한 OpenClaw의 세 가지 중요한 격차
한 개발자가 OpenClaw에서 AI 에이전트가 진정한 직원으로 기능하는 것을 막는 세 가지 부족한 능력을 지적했습니다: 감사 가능성, 세부적인 행동 제어, 그리고 지시 해결 능력입니다.

TranslateGemma-12b: 인간 검토, 자동 평가가 놓친 오류의 71% 발견
인간 MQM 검토에서 자동 메트릭이 깨끗하다고 평가한 번역 세그먼트의 71%에서 문제가 발견되었으며, 25개의 정확성 오류 모두 메트릭이 감지하지 못한 사분면에 있었습니다.

Anthropic의 '미토스' 유출로 잠재적 고성능 시스템이 드러나다
유출된 문서들은 클로드 미토스를 '성능의 단계적 변화'로 묘사하며 '전례 없는 사이버 보안 위험'과 진보된 사이버 역량을 지녔다고 설명합니다. 한편, Anthropic의 3800억 달러 가치 평가는 공개적인 '안전성' 담론을 유지하도록 구조적 유인을 창출합니다.