Grok 4.5 대 클로드 코드: 달러당 허용된 변경사항이 진정한 벤치마크다

✍️ OpenClawRadar📅 게시일: July 23, 2026🔗 Source
Ad

xAI의 Grok 4.5 출시 (DeepSWE 1.1에서 53% vs Opus 4.8의 59%, SWE Marathon에서 pass@1 29.0% vs 26.0%, $2/백만 입력 토큰, $6/백만 출력 토큰, 80토큰/초)는 단순한 리더보드 주장이 아닌 실용적인 Claude Code 비교로 다룰 가치가 있습니다. AI 코딩 에이전트를 사용하는 개발자에게 올바른 지표는 동일한 저장소, 프롬프트, 도구 권한, 테스트 명령, 타임아웃, 검토 기준으로 측정한 달러당 승인된 변경 사항입니다.

주요 세부 사항

Grok 4.5는 Grok Build, Cursor 및 API를 통해 사용할 수 있습니다. 낮음, 중간, 높음 추론 모드를 지원합니다. 그러나 7월 20일 제3자 테스트(The New Stack 제공)는 Cursor Agent 모드에서 Grok과 Opus를 세 가지 동일한 Rust 작업에서 실행했습니다:

  • 버그 수정: 둘 다 첫 번째 테스트를 통과했습니다.
  • 다중 파일 리팩터링: 둘 다 완료했지만 Opus가 파일 하나를 더 수정했습니다.
  • 기능 구축(가장 실용적인 테스트): 둘 다 작동했지만 Opus가 더 많은 테스트 커버리지를 추가하고 매뉴얼 페이지 항목을 작성했습니다.

Opus의 추가 수정은 달러당 승인된 변경 사항에 중요합니다. 수리 루프가 한 번 더 필요한 저렴한 모델은 실제로 더 저렴하지 않을 수 있습니다. 커뮤니티에서는 다음을 기록할 것을 권장합니다: 첫 번째 테스트 성공 여부, 재작업 횟수, 출력 토큰, 실제 소요 시간, 검토자 수정 사항.

대상 독자

Claude Code, Cursor 또는 Grok Build를 에이전트 코딩에 사용하며, 전달된 변경 사항의 총 비용을 평가하려는 모든 사람.

📖 전체 출처 읽기: r/ClaudeAI

Ad

👀 See Also

15개 멀티모달 AI 모델의 시각 추론 벤치마크 결과
News

15개 멀티모달 AI 모델의 시각 추론 벤치마크 결과

AIMultiple는 차트 이해와 시각적 논리라는 두 가지 트랙에서 200개의 시각적 추론 질문을 통해 15개의 주요 멀티모달 AI 모델을 벤치마크했습니다. Gemini-3.1-pro-preview와 Gemini-3-pro-preview가 전체 결과를 선도했으며, 그 뒤를 GPT-5.2, Kimi-K2.5, GPT-5.2-pro가 따랐습니다.

OpenClawRadar
AI 버블은 인터넷 버블과 다르다 — 근로자들은 스프레드시트를 밀반입한 것처럼 AI를 밀반입하지 않을 것이다
News

AI 버블은 인터넷 버블과 다르다 — 근로자들은 스프레드시트를 밀반입한 것처럼 AI를 밀반입하지 않을 것이다

코리 닥터로우는 AI 거품이 닷컴 시대와 근본적으로 다르다고 주장한다. 당시 직원들은 업무에 도움되는 웹 도구를 회사 네트워크로 밀반입했지만, AI 에이전트를 밀반입하는 사람은 없다. 오히려 경영진이 강제로 주입하려 한다.

OpenClawRadar
AI 품질 검사 부족으로 포드, 300명 이상 베테랑 엔지니어 재고용
News

AI 품질 검사 부족으로 포드, 300명 이상 베테랑 엔지니어 재고용

포드는 AI 검사 시스템이 숙련공의 전문성을 따라잡지 못해 300명 이상의 베테랑 엔지니어를 재고용했습니다. 충분치 않은 훈련 데이터와 경험 직원의 이탈이 원인으로 지목됐습니다.

OpenClawRadar
Opus 4.7 토큰 효율성: 독일어 프롬프트가 영어 대비 최대 2배의 토큰 소모
News

Opus 4.7 토큰 효율성: 독일어 프롬프트가 영어 대비 최대 2배의 토큰 소모

Claude Pro 구독자가 보고한 바에 따르면 Opus 4.7에서 독일어를 사용하면 세션 토큰이 몇 초 만에 100% 소모된 반면, 영어는 37%를 사용했습니다. 토크나이저 비효율성은 복합 명사와 움라우트에서 비롯되며, 토큰 사용량이 1.5~2배 증가합니다.

OpenClawRadar