Grok 4.5 대 클로드 코드: 달러당 허용된 변경사항이 진정한 벤치마크다

✍️ OpenClawRadar📅 게시일: July 23, 2026🔗 Source
Ad

xAI의 Grok 4.5 출시 (DeepSWE 1.1에서 53% vs Opus 4.8의 59%, SWE Marathon에서 pass@1 29.0% vs 26.0%, $2/백만 입력 토큰, $6/백만 출력 토큰, 80토큰/초)는 단순한 리더보드 주장이 아닌 실용적인 Claude Code 비교로 다룰 가치가 있습니다. AI 코딩 에이전트를 사용하는 개발자에게 올바른 지표는 동일한 저장소, 프롬프트, 도구 권한, 테스트 명령, 타임아웃, 검토 기준으로 측정한 달러당 승인된 변경 사항입니다.

주요 세부 사항

Grok 4.5는 Grok Build, Cursor 및 API를 통해 사용할 수 있습니다. 낮음, 중간, 높음 추론 모드를 지원합니다. 그러나 7월 20일 제3자 테스트(The New Stack 제공)는 Cursor Agent 모드에서 Grok과 Opus를 세 가지 동일한 Rust 작업에서 실행했습니다:

  • 버그 수정: 둘 다 첫 번째 테스트를 통과했습니다.
  • 다중 파일 리팩터링: 둘 다 완료했지만 Opus가 파일 하나를 더 수정했습니다.
  • 기능 구축(가장 실용적인 테스트): 둘 다 작동했지만 Opus가 더 많은 테스트 커버리지를 추가하고 매뉴얼 페이지 항목을 작성했습니다.

Opus의 추가 수정은 달러당 승인된 변경 사항에 중요합니다. 수리 루프가 한 번 더 필요한 저렴한 모델은 실제로 더 저렴하지 않을 수 있습니다. 커뮤니티에서는 다음을 기록할 것을 권장합니다: 첫 번째 테스트 성공 여부, 재작업 횟수, 출력 토큰, 실제 소요 시간, 검토자 수정 사항.

대상 독자

Claude Code, Cursor 또는 Grok Build를 에이전트 코딩에 사용하며, 전달된 변경 사항의 총 비용을 평가하려는 모든 사람.

📖 전체 출처 읽기: r/ClaudeAI

Ad

👀 See Also