Grok 4.5 대 클로드 코드: 달러당 허용된 변경사항이 진정한 벤치마크다
xAI의 Grok 4.5 출시 (DeepSWE 1.1에서 53% vs Opus 4.8의 59%, SWE Marathon에서 pass@1 29.0% vs 26.0%, $2/백만 입력 토큰, $6/백만 출력 토큰, 80토큰/초)는 단순한 리더보드 주장이 아닌 실용적인 Claude Code 비교로 다룰 가치가 있습니다. AI 코딩 에이전트를 사용하는 개발자에게 올바른 지표는 동일한 저장소, 프롬프트, 도구 권한, 테스트 명령, 타임아웃, 검토 기준으로 측정한 달러당 승인된 변경 사항입니다.
주요 세부 사항
Grok 4.5는 Grok Build, Cursor 및 API를 통해 사용할 수 있습니다. 낮음, 중간, 높음 추론 모드를 지원합니다. 그러나 7월 20일 제3자 테스트(The New Stack 제공)는 Cursor Agent 모드에서 Grok과 Opus를 세 가지 동일한 Rust 작업에서 실행했습니다:
- 버그 수정: 둘 다 첫 번째 테스트를 통과했습니다.
- 다중 파일 리팩터링: 둘 다 완료했지만 Opus가 파일 하나를 더 수정했습니다.
- 기능 구축(가장 실용적인 테스트): 둘 다 작동했지만 Opus가 더 많은 테스트 커버리지를 추가하고 매뉴얼 페이지 항목을 작성했습니다.
Opus의 추가 수정은 달러당 승인된 변경 사항에 중요합니다. 수리 루프가 한 번 더 필요한 저렴한 모델은 실제로 더 저렴하지 않을 수 있습니다. 커뮤니티에서는 다음을 기록할 것을 권장합니다: 첫 번째 테스트 성공 여부, 재작업 횟수, 출력 토큰, 실제 소요 시간, 검토자 수정 사항.
대상 독자
Claude Code, Cursor 또는 Grok Build를 에이전트 코딩에 사용하며, 전달된 변경 사항의 총 비용을 평가하려는 모든 사람.
📖 전체 출처 읽기: r/ClaudeAI
👀 See Also

메타 오픈엔브 AI 해커톤 인도 개최, 직접 인터뷰 기회와 3만 달러 상금 풀 제공
메타가 허깅 페이스와 파이토치와 협력하여 인도 최초의 OpenEnv AI 해커톤을 개최합니다. 개발자들은 AI 에이전트를 위한 강화 학습 환경을 구축하게 됩니다. 상위 팀은 메타와 허깅 페이스 AI 팀과의 직접 인터뷰 기회와 함께 30,000달러의 상금 풀을 획득합니다.

OpenClaw 클라이언트, 비용 추적 및 에이전트별 지출 한도 추가
새 릴리스에서는 에이전트별 지출 상한, 원형 진행 표시줄이 있는 실시간 사용량 UI, 하위 에이전트 관리, 스킬 토글, 에이전트별 모델 선택 기능이 추가되었습니다.

Nvidia, 260억 달러 투입해 오픈 가중치 AI 모델에 전념하며 '네모트론 3 슈퍼' 공개
2025년 재무 제출 자료에 따르면 엔비디아는 5년 동안 260억 달러를 투자해 오픈 소스 AI 모델을 구축할 예정입니다. 또한 회사는 벤치마크에서 GPT-OSS를 능가하고 OpenClaw 제어를 위한 PinchBench에서 1위를 차지한 1280억 파라미터 모델인 Nemotron 3 Super를 공개했습니다.

폴시아 플랫폼, 라이브 창업자 런칭에서 반복되는 SaaS 패턴 보여줘
폴시아는 사용자가 자신의 비즈니스를 설명하고 비용을 지불하면 자율적으로 실행되는 자율 비즈니스 플랫폼입니다. 한 행동 과학자가 72시간 동안 진행된 실시간 창업자 런칭을 관찰하여 AI SDR 자동화 솔루션과 충분히 공략되지 않은 국제 시장과 같은 반복적인 패턴을 확인했습니다.