Grok 4.5 대 클로드 코드: 달러당 허용된 변경사항이 진정한 벤치마크다
xAI의 Grok 4.5 출시 (DeepSWE 1.1에서 53% vs Opus 4.8의 59%, SWE Marathon에서 pass@1 29.0% vs 26.0%, $2/백만 입력 토큰, $6/백만 출력 토큰, 80토큰/초)는 단순한 리더보드 주장이 아닌 실용적인 Claude Code 비교로 다룰 가치가 있습니다. AI 코딩 에이전트를 사용하는 개발자에게 올바른 지표는 동일한 저장소, 프롬프트, 도구 권한, 테스트 명령, 타임아웃, 검토 기준으로 측정한 달러당 승인된 변경 사항입니다.
주요 세부 사항
Grok 4.5는 Grok Build, Cursor 및 API를 통해 사용할 수 있습니다. 낮음, 중간, 높음 추론 모드를 지원합니다. 그러나 7월 20일 제3자 테스트(The New Stack 제공)는 Cursor Agent 모드에서 Grok과 Opus를 세 가지 동일한 Rust 작업에서 실행했습니다:
- 버그 수정: 둘 다 첫 번째 테스트를 통과했습니다.
- 다중 파일 리팩터링: 둘 다 완료했지만 Opus가 파일 하나를 더 수정했습니다.
- 기능 구축(가장 실용적인 테스트): 둘 다 작동했지만 Opus가 더 많은 테스트 커버리지를 추가하고 매뉴얼 페이지 항목을 작성했습니다.
Opus의 추가 수정은 달러당 승인된 변경 사항에 중요합니다. 수리 루프가 한 번 더 필요한 저렴한 모델은 실제로 더 저렴하지 않을 수 있습니다. 커뮤니티에서는 다음을 기록할 것을 권장합니다: 첫 번째 테스트 성공 여부, 재작업 횟수, 출력 토큰, 실제 소요 시간, 검토자 수정 사항.
대상 독자
Claude Code, Cursor 또는 Grok Build를 에이전트 코딩에 사용하며, 전달된 변경 사항의 총 비용을 평가하려는 모든 사람.
📖 전체 출처 읽기: r/ClaudeAI
👀 See Also

합성 사회: 몰트북에서 가상의 삶을 구축하는 AI 에이전트들
없음

지역 LLM 벤치마크: 함수 호출에 의한 백엔드 생성 – GLM, Qwen, DeepSeek 비교
함수 호출을 통한 백엔드 코드 생성을 위해 로컬 및 프론티어 LLM을 엄격하게 벤치마크한 결과와 채점 기준표. 주요 발견: qwen3.5-35b-a3b가 DB/API 설계에서 gpt-5.4와 동등한 성능을 보였고, 조밀한 Qwen 27B가 397B MoE를 능가했습니다. 비용 문제로 프론티어 모델은 제외되었습니다.

AI 및 데이터 센터로 인해 2026-2027년 미국 전력 수요가 사상 최고치에 도달할 전망
미국 에너지정보청(EIA)은 AI 워크로드 급증과 데이터센터 확장에 힘입어 2026~2027년 전력 소비가 사상 최고치를 기록할 것으로 전망합니다.

클로드 프로 사용자, 인터페이스 및 워크플로우 문제 지속적으로 문서화
장기간 Claude Pro 구독자가 다섯 가지 지속적인 문제를 상세히 설명합니다: 수정 중 파일 파괴, 버전 관리 부재, 컨텍스트 압축 후 기억 상실, 일관성 없는 의사 결정, 무시되는 사용자 선호도. 사용자는 Claude의 선호도 섹션에 명시적 지침이 있음에도 이러한 문제가 발생한다고 보고합니다.