100GB 미만의 오픈 웨이트 모델은 코딩 벤치마크에서 Claude Haiku를 이기지 못합니다.

최근 오픈 웨이트 언어 모델 분석 결과, 코딩 벤치마크에서 Anthropic의 Claude Haiku와 비교해 상당한 성능 차이가 드러났습니다. 이 비교는 특정 테스트 매개변수와 메모리 요구 사항을 사용해 수행되었습니다.
벤치마크 방법론
평가는 두 가지 코딩 벤치마크인 LiveBench(2026년 1월)와 Arena Code/WebDev에서 모델을 비교했습니다. 테스트는 사고 능력이 활성화된 Claude Haiku 4.5에 대해 수행되었습니다. 모델은 로컬 배포를 위한 메모리 요구 사항에 따라 도표화되었습니다.
기술 사양
- 양자화: Q4_K_M
- 컨텍스트 길이: 32K
- KV 캐시: q8_0
- VRAM 추정: 저자의 맞춤 계산기를 사용해 계산됨
주요 발견 사항
100GB 미만 메모리의 오픈 웨이트 모델 중 어느 것도 두 벤치마크에서 Claude Haiku의 성능에 근접하지 못했습니다. 가장 가까운 경쟁자는 약 136GB의 메모리가 필요한 Minimax M2.5로, 두 벤치마크 모두에서 Haiku의 성능과 대략 일치합니다.
이 분석은 코딩 작업에서 100GB 미만 범주의 독점 모델과 오픈 웨이트 모델 간 현재 격차를 강조합니다. 저자는 이러한 한계에 대해 좌절감을 표현하며, 적어도 Haiku의 능력과 맞먹을 수 있는 더 작은 모델 개발을 촉구합니다.
📖 전체 출처 읽기: r/LocalLLaMA
👀 See Also

클로드 상태 업데이트: 오픈스 4.6과 소넷 4.6의 오류율 증가
공식 Claude 시스템 상태 업데이트 보고서에 따르면 Opus 4.6과 Sonnet 4.6 모델의 오류율이 상승했으며, 이 사건은 2026-03-31T21:10:28.000Z에 기록되었습니다. 자동 게시물은 사용자에게 해결 상태와 커뮤니티 성능 보고서를 확인하도록 안내합니다.

클로드 구독으로 더 이상 서드파티 하네스 사용이 지원되지 않습니다.
내일 오후 12시(태평양 표준시)부터 Claude 구독이 OpenClaw와 같은 타사 하네스 사용을 더 이상 포함하지 않습니다. 사용자는 추가 사용량 번들 또는 Claude API 키를 통해 이러한 하네스에 계속 접근할 수 있습니다.

펜타곤, 군사 AI 사용을 둘러싼 분쟁 속 앤트로픽에 최종 제안 전달
미국 국방부는 Anthropic에 클로드 AI 모델의 무제한 군사적 사용을 위한 최종 제안을 보냈으며, 금요일까지 완전한 접근 권한을 부여하지 않으면 군사 계약을 잃고 공급망 위험으로 분류될 수 있다는 마감 기한을 설정했습니다.

Claude Code: 피드백 허니팟이 개인정보 차단 설정을 무시함 — 사용자 세션 대화 기록 함정 보고
Anthropic의 Claude Code가 사용자에게 세션 기록 검토를 허용하도록 요청합니다. 'n'을 누르면 '피드백 감사합니다'라고 표시되며 여전히 모델 훈련에 사용될 수 있습니다. 닫기 키 동작은 명확하지 않습니다.