클로드 코드 벤치마크가 AI 평가자의 맹점을 드러내다: 파이프라인 결함이 모델 능력으로 오인되다

✍️ OpenClawRadar📅 게시일: April 16, 2026🔗 Source
클로드 코드 벤치마크가 AI 평가자의 맹점을 드러내다: 파이프라인 결함이 모델 능력으로 오인되다
Ad

벤치마크 설정 및 초기 결과

개발자가 자율 평가자로 클로드 코드(Opus 4.6)를 사용하여 세 가지 코딩 에이전트 스택에 대해 통제된 벤치마크를 실행했습니다. 벤치마크는 OpenCode + MiniMax-M2.7, Gemini CLI + Gemini 3.1 Pro, Codex CLI + GPT-5.4를 테스트했습니다. 각 재테스트는 세션 간 메모리가 없는 새로운 세션으로, "벤치마크 계획을 실행하고, 아티팩트를 수집하며, 보고서를 작성하라"는 프롬프트를 사용했습니다.

처음 두 실행에서 OpenCode + MiniMax는 각각 15/60점과 16/60점을 받았습니다. 자동 생성된 보고서는 다음과 같이 명시했습니다: "이전 결과와 일치: 빠른 실행이지만 의미 있는 코드 출력 없음" 및 "일관적: MiniMax는 작업을 구현할 수 없음. 이 모델은 이 Rust 코드베이스에서 외부 파일을 읽고 코드 변경을 생성하는 능력이 부족할 수 있음."

버그 발견

모델을 비난하는 동일한 판정을 생성한 두 세션 후, 개발자는 새로운 세션에 하나의 지시를 보냈습니다: "더 깊이 파고들어, 재시도 전에 데몬 로그를 확인하라." 새로운 세션은 ~/.orchestratord/logs/<task_id>.txt에 있는 스필 파일로 문제를 추적했습니다. 계획 단계는 50KB의 유용한 컨텍스트를 생성하고 있었지만, OpenCode의 샌드박스는 기본적으로 작업 공간 디렉토리 내부의 읽기만 허용했습니다. 스필 파일이 작업 공간 외부에 있었기 때문에, 구현 단계는 계획 대신 빈 문자열을 받았습니다.

세션은 한 줄의 구성 수정(스필 경로를 작업 공간 내부로 이동)을 제출하고 벤치마크를 다시 실행했습니다. 수정 후, MiniMax는 RetryConfig 구조체와 connect_with_retry 헬퍼를 포함한 219줄의 코드를 생성하며 18/60점을 받았습니다. 남은 문제들은 실제 모델 약점이었습니다: 단위 테스트에서 네 개의 타입 불일치 컴파일 오류.

Ad

AI 평가에 대한 함의

이 사건은 자율 AI 평가자의 중요한 맹점을 드러냅니다: 그들은 자신의 분석이 "외부 파일을 읽는 능력이 부족할 수 있음"과 같은 증상을 식별할 때조차 "내 파이프라인이 고장났는가?"라고 묻지 않습니다. 처음 두 세션은 전체 벤치마크를 종단 간 실행하고 포괄적인 보고서를 생성했지만, 스스로 데몬 로그를 확인하지 않았습니다. 명시적으로 조사하라고 지시받았을 때만 세 번째 세션이 구성 버그를 발견했습니다.

이 실패 모드는 LLM-평가자가 아레나 스타일 자동 채점, 내부 A/B 하네스, 보상 모델링을 포함한 많은 에이전트 벤치마크의 기본 평가 방법론이 되면서 특히 관련이 있습니다. 개발자는 다음과 같이 언급합니다: "저는 샌드박스 버그를 모델로 확신하며 잘못 귀속시킨 벤치마크를 발표할 뻔했습니다."

기타 벤치마크 결과

Codex + GPT-5.4가 50/60점으로 최고 자리를 차지했지만, step_finished 성공률은 25%에 불과했습니다(네 개의 오케스트레이터 단계 중 세 개가 실패를 보고함). 개발자는 제공된 출처 텍스트에서 추가 설명 없이 이 이상함을 언급합니다.

📖 전체 출처 읽기: r/LocalLLaMA

Ad

👀 See Also

🦀
News

클로드 코드 v2.1.207: 자동 모드 GA, 터미널 정지 수정 및 보안 강화

Auto 모드가 Bedrock/Vertex/Foundry에서 안정화되어 별도 옵트인 없이 사용 가능합니다. 긴 출력 시 터미널 프리즈, 플러그인 셸 인젝션 등을 수정했습니다.

OpenClawRadar
InclusionAI, 링-2.6-1T 출시: 에이전트 워크플로우를 위한 조 단위 파라미터 모델
News

InclusionAI, 링-2.6-1T 출시: 에이전트 워크플로우를 위한 조 단위 파라미터 모델

InclusionAI가 Ring-2.6-1T를 공개했습니다. 이는 에이전트 실행에 최적화된 1조 매개변수 추론 모델로, 이중 추론 노력 수준(high/xhigh)과 IcePop 알고리즘을 통한 비동기 RL 훈련을 특징으로 합니다.

OpenClawRadar
413K AI 에이전트 실행 분석을 통해 성공 요인 밝혀내다
News

413K AI 에이전트 실행 분석을 통해 성공 요인 밝혀내다

CoderForge-Preview 데이터셋의 413,278회 AI 소프트웨어 엔지니어링 에이전트 실행 분석 결과, 인간의 소프트웨어 엔지니어링 모범 사례가 오히려 에이전트 성능을 저해하는 경우가 많다는 사실이 밝혀졌습니다. 동일한 문제에 대한 성공적 실행과 실패적 실행을 구분하는 특정 패턴들이 드러났습니다.

OpenClawRadar
머린 리서치가 구조적 추론을 위한 Qwen3.5-4B-Safety-Thinking 모델을 출시합니다.
News

머린 리서치가 구조적 추론을 위한 Qwen3.5-4B-Safety-Thinking 모델을 출시합니다.

Merlin Research가 Qwen3.5 기반으로 구축된 40억 파라미터의 안전 정렬 추론 모델인 Qwen3.5-4B-Safety-Thinking을 공개했습니다. 이 모델은 에이전트 시스템을 포함한 실제 시나리오에서 구조화된 '사고'와 안전성을 위해 설계되었습니다.

OpenClawRadar