클로드 오푸스 4.7 분석: 최고 수준의 지능, 그러나 높은 비용과 장황함

클로드 오푸스 4.7 성능 분석
Artificial Analysis는 클로드 오푸스 4.7(적응형 추론, 최대 노력)에 대한 상세한 지능, 성능 및 가격 데이터를 발표했습니다. Anthropic의 이 독점 모델은 2026년 4월에 출시되었으며 텍스트 및 이미지 입력과 텍스트 출력을 지원합니다.
주요 지표 및 순위
- 지능: 인공 분석 지능 지수에서 57점으로 133개 모델 중 1위(평균 31점)
- 속도: 초당 50개 출력 토큰으로 133개 모델 중 71위(평균 61개)
- 입력 가격: 토큰 100만 개당 5.00 USD로 133개 모델 중 116위(평균 1.40달러)
- 출력 가격: 토큰 100만 개당 25.00 USD로 133개 모델 중 117위(평균 8.40달러)
- 장황함: 평가 중 1억 토큰을 생성하여 133개 모델 중 96위(평균 3500만 토큰)
기술 사양
- 추론 모델(전구 아이콘은 추론 능력을 나타냄)
- 100만 토큰 컨텍스트 창(~1500페이지 A4 용지, 12포인트 Arial 글꼴 크기)
- 지식 컷오프: 2026년 1월 1일
- 평가 비용: 지능 지수 실행에 4406.45달러 소요
비교 맥락
이 모델은 동급 133개 모델과 비교됩니다. 클로드 오푸스 4.7과 같은 독점 모델은 동일한 가격대의 독점 및 오픈 가중치 모델과 3:1 입력/출력 가격 비율을 혼합하여 비교됩니다. 인공 분석 지능 지수 v4.0에는 10가지 평가가 포함됩니다: GDPval-AA, τ²-Bench Telecom, Terminal-Bench Hard, SciCode, AA-LCR, AA-Omniscience, IFBench, Humanity's Last Exam, GPQA Diamond 및 CritPt.
분석 결과, 클로드 오푸스 4.7은 지능 면에서 선두 모델 중 하나이지만 유사한 가격대의 다른 모델에 비해 특히 비싼 것으로 결론지어집니다. 또한 평균보다 느리고 출력이 매우 장황합니다.
📖 Read the full source: HN AI Agents
👀 See Also
Claude Code v2.1.248: 제한 모드, 캐시 TTL 및 세션 수정
Claude Code v2.1.248은 샌드박스 파일 액세스를 위한 제한 모드, 에이전트별 캐시 TTL, 세션 간 메시징을 추가하고 프롬프트 캐시 누락 및 세션 처리 문제를 수정했습니다.

로컬 vs 클라우드 모델: 하드 코드 생성에서 Qwen-3.6-27B, Gemma-4-31B, Claude Haiku, Codex-Spark 비교
한 사용자가 RTX 5080에서 로컬로 실행한 Qwen-3.6-27B(q4_k_m)와 API 기반 Gemma-4-31B, Claude Haiku 4.5, Codex-Spark를 복잡한 코드 작업에서 비교했습니다. 오직 Codex-Spark만이 완전한 코드를 생성했지만(가져오기 오류 발생), 나머지는 모두 부분적으로 실패했습니다. 비용: Gemma는 803k 입력 토큰에 $0.112를 사용했습니다.

AI 생성 코드의 양이 시니어 엔지니어들을 압도하고 있다는 연구 결과가 나왔습니다.
AI 사용자는 AI 지원으로 풀 리퀘스트를 98% 더 많이 병합하지만, 시니어 엔지니어들은 인지 부하와 번아웃 증가를 보고합니다. 연구에 따르면, 100줄 미만의 PR에 대한 결함 탐지율은 87%인 반면, 1,000줄 이상의 PR에 대해서는 28%로 떨어집니다.

SDL 프로젝트, GitHub 이슈에 대응해 AI 작성 커밋 금지
SDL 프로젝트는 GitHub 이슈에서 Copilot 사용에 대한 우려가 제기된 후 AI 생성 커밋을 금지하는 정책을 시행했습니다. 이 이슈는 특히 리뷰 #13277과 #12730을 AI 지원이 감지된 사례로 언급했습니다.