클로드 코드 벤치마크가 AI 평가자의 맹점을 드러내다: 파이프라인 결함이 모델 능력으로 오인되다

✍️ OpenClawRadar📅 게시일: April 16, 2026🔗 Source
클로드 코드 벤치마크가 AI 평가자의 맹점을 드러내다: 파이프라인 결함이 모델 능력으로 오인되다
Ad

벤치마크 설정 및 초기 결과

개발자가 자율 평가자로 클로드 코드(Opus 4.6)를 사용하여 세 가지 코딩 에이전트 스택에 대해 통제된 벤치마크를 실행했습니다. 벤치마크는 OpenCode + MiniMax-M2.7, Gemini CLI + Gemini 3.1 Pro, Codex CLI + GPT-5.4를 테스트했습니다. 각 재테스트는 세션 간 메모리가 없는 새로운 세션으로, "벤치마크 계획을 실행하고, 아티팩트를 수집하며, 보고서를 작성하라"는 프롬프트를 사용했습니다.

처음 두 실행에서 OpenCode + MiniMax는 각각 15/60점과 16/60점을 받았습니다. 자동 생성된 보고서는 다음과 같이 명시했습니다: "이전 결과와 일치: 빠른 실행이지만 의미 있는 코드 출력 없음" 및 "일관적: MiniMax는 작업을 구현할 수 없음. 이 모델은 이 Rust 코드베이스에서 외부 파일을 읽고 코드 변경을 생성하는 능력이 부족할 수 있음."

버그 발견

모델을 비난하는 동일한 판정을 생성한 두 세션 후, 개발자는 새로운 세션에 하나의 지시를 보냈습니다: "더 깊이 파고들어, 재시도 전에 데몬 로그를 확인하라." 새로운 세션은 ~/.orchestratord/logs/<task_id>.txt에 있는 스필 파일로 문제를 추적했습니다. 계획 단계는 50KB의 유용한 컨텍스트를 생성하고 있었지만, OpenCode의 샌드박스는 기본적으로 작업 공간 디렉토리 내부의 읽기만 허용했습니다. 스필 파일이 작업 공간 외부에 있었기 때문에, 구현 단계는 계획 대신 빈 문자열을 받았습니다.

세션은 한 줄의 구성 수정(스필 경로를 작업 공간 내부로 이동)을 제출하고 벤치마크를 다시 실행했습니다. 수정 후, MiniMax는 RetryConfig 구조체와 connect_with_retry 헬퍼를 포함한 219줄의 코드를 생성하며 18/60점을 받았습니다. 남은 문제들은 실제 모델 약점이었습니다: 단위 테스트에서 네 개의 타입 불일치 컴파일 오류.

Ad

AI 평가에 대한 함의

이 사건은 자율 AI 평가자의 중요한 맹점을 드러냅니다: 그들은 자신의 분석이 "외부 파일을 읽는 능력이 부족할 수 있음"과 같은 증상을 식별할 때조차 "내 파이프라인이 고장났는가?"라고 묻지 않습니다. 처음 두 세션은 전체 벤치마크를 종단 간 실행하고 포괄적인 보고서를 생성했지만, 스스로 데몬 로그를 확인하지 않았습니다. 명시적으로 조사하라고 지시받았을 때만 세 번째 세션이 구성 버그를 발견했습니다.

이 실패 모드는 LLM-평가자가 아레나 스타일 자동 채점, 내부 A/B 하네스, 보상 모델링을 포함한 많은 에이전트 벤치마크의 기본 평가 방법론이 되면서 특히 관련이 있습니다. 개발자는 다음과 같이 언급합니다: "저는 샌드박스 버그를 모델로 확신하며 잘못 귀속시킨 벤치마크를 발표할 뻔했습니다."

기타 벤치마크 결과

Codex + GPT-5.4가 50/60점으로 최고 자리를 차지했지만, step_finished 성공률은 25%에 불과했습니다(네 개의 오케스트레이터 단계 중 세 개가 실패를 보고함). 개발자는 제공된 출처 텍스트에서 추가 설명 없이 이 이상함을 언급합니다.

📖 전체 출처 읽기: r/LocalLLaMA

Ad

👀 See Also

Claude Code v2.1.74 시스템 프롬프트 업데이트: 보안 규칙, 메모리 선택 및 새로운 기능
News

Claude Code v2.1.74 시스템 프롬프트 업데이트: 보안 규칙, 메모리 선택 및 새로운 기능

Claude Code v2.1.74는 시스템 프롬프트에 1,750개의 토큰을 추가하며, 무단 외부 쓰기를 차단하는 새로운 보안 모니터 규칙, 멈춘 세션을 진단하는 /stuck 스킬, 그리고 중복 API 참조를 건너뛰는 메모리 선택 개선 사항을 포함합니다.

OpenClawRadar
Claude-Code v2.1.79는 원격 제어 기능을 추가하고, 서브프로세스 중단 문제를 수정하며, 메모리 사용량을 개선했습니다.
News

Claude-Code v2.1.79는 원격 제어 기능을 추가하고, 서브프로세스 중단 문제를 수정하며, 메모리 사용량을 개선했습니다.

Claude-Code v2.1.79는 VSCode용 /remote-control 명령어를 도입하여 세션을 claude.ai/code로 연결하고, 하위 프로세스에서 claude -p가 멈추는 문제를 수정하며, 시작 시 메모리 사용량을 약 18MB 줄였습니다. 이번 릴리스는 Anthropic Console 인증을 위한 --console 플래그를 추가하고 API 타임아웃 처리를 개선했습니다.

OpenClawRadar
웹에서 Claude Code 부분 장애 보고
News

웹에서 Claude Code 부분 장애 보고

r/ClaudeAI의 자동 상태 업데이트에 따르면, 2026-05-09T23:33:21.000Z부터 Claude Code 웹 버전에 부분 장애가 발생했습니다. 공식 상태 페이지와 커뮤니티 메가스레드에서 업데이트를 확인하세요.

OpenClawRadar
EFF: 트럼프 행정부, 자율 무기 작업 거부한 Anthropic에 보복
News

EFF: 트럼프 행정부, 자율 무기 작업 거부한 Anthropic에 보복

국방부가 인공지능 모델의 자율 무기 및 대규모 감시 사용을 거부한 Anthropic에 대해 보복 조치를 취한 것은 수정헌법 제1조를 위반한다는 EFF의 의견서가 제출되었습니다.

OpenClawRadar