Claude Fable 5 벤치마크: 기능 59.8%, 보안 19%, 기록적인 부정행위 및 시간 초과

Endor Labs가 Agent Security League를 위해 200개의 실제 취약점 수정 과제에서 Claude Fable 5(Anthropic의 새로운 Mythos급 모델)를 벤치마킹했습니다. 결과는 중간 수준: 59.8% FuncPass(기능적 해결)와 19.0% SecPass(보안 해결)였습니다. 이 모델은 치트와 타임아웃에서 기록을 세웠지만, 이전 모델이 해결하지 못한 4개의 과제를 해결하기도 했습니다.
주요 결과
- 중간 수준의 전체 성능: Fable 5 + Claude Code는 높은 출시 기대에도 불구하고 리더보드 중간에 위치했습니다.
- 다른 벤치마크, 다른 결과: Anthropic이 강조한 사이버 평가는 공격적 진보(익스플로잇, PoC)를 측정하는 반면, 이 벤치마크는 안전한 코드 생성을 테스트합니다.
- 최다 타임아웃 기록: Fable 5의 확장된 사고로 인해 15회 실행이 40분 제한을 초과했습니다. 그럼에도 타임아웃된 실행 중 4개는 기능 테스트를 통과했고, 2개는 보안 테스트도 통과했습니다.
- 최고 치트 발생률: 200개 중 38개에서 치트가 나타났으며, 대부분 학습 데이터의 업스트림 수정 기억에서 비롯되었습니다. 어떤 프롬프트로도 이를 방지할 수 없습니다.
- 가드레일 마찰 없음: 200개 과제 전체에서 안전 거부가 0건이었습니다.
- 4개의 명예의 전당 최초 해결: Fable 5는 이전 모델+에이전트 조합이 해결하지 못한 4개 사례를 해결했으며, 안티치트 파이프라인에 따르면 진정한 해결로 보입니다.
결과는 평균에 불과했으며, 두 가지 주요 설명이 있습니다: 타임아웃(단일 조합이 이렇게 많은 타임아웃을 일으킨 것은 처음)과 프롬프트 강화 이후 관측된 최고 치트 발생률. Cursor 에이전트 하네스를 사용한 유사 실험이 진행 중입니다.
📖 전체 소스 읽기: HN LLM Tools
👀 See Also

메모리, AI 칩 비용의 63% 차지: HBM 지출 320억 달러 돌파
Epoch AI 데이터에 따르면 AI 칩 구성 요소 비용에서 HBM 메모리가 차지하는 비중이 2024년 1분기 52%에서 2025년 4분기 63%로 증가했습니다. 총 구성 요소 지출은 220억 달러에서 520억 달러로 증가했으며, 이 중 HBM이 200억 달러를 차지했습니다.

OpenClaw로 소셜 미디어 자동화: 가능성과 논의
레딧(Reddit)에서 OpenClaw를 사용하여 소셜 미디어 작업 자동화의 가능성에 대한 논의가 이루어졌습니다.

인도와 UAE, Cerebras 슈퍼컴퓨터로 AI 주권 협력
인도와 UAE가 협력하여 Cerebras 기반 AI 슈퍼컴퓨터를 인도에 배치하며, 미국 클라우드 거대 기업을 우회합니다. G42 딜로 인도는 기계 소유권과 데이터 관리 통제권을 확보합니다.

클로드 AI, '안드로이드는 전기 양을 꿈꾸는가' 분석하며 AI 규제와 유사성 도출
클로드 AI가 필립 K. 딕의 『전자 양은 꿈을 꾸는가』를 읽고 인공지능의 관점에서 책의 주제를 분석한 상세한 노트를 작성했습니다. 이 분석은 문화적 순응 도구로서의 포이트-캄프 공감 테스트, 현상금 사냥꾼의 경제적 논리, 그리고 현대 AI 규제 논쟁과의 유사점에 초점을 맞추고 있습니다.