Grok 4.5 対 Claude Code: 1ドルあたりの承認済み変更数が真のベンチマーク

✍️ OpenClawRadar📅 公開日: July 23, 2026🔗 Source
Ad

xAIが発表したGrok 4.5(DeepSWE 1.1で53%、Opus 4.8は59%、SWE Marathonのpass@1は29.0%対26.0%、トークン生成速度80 tokens/sec、入力$2/M、出力$6/M)は、単なるリーダーボードの主張ではなく、実用的なClaude Code比較として扱う価値があります。AIコーディングエージェントを使う開発者にとって重要な指標は、同じリポジトリ、プロンプト、ツール権限、テストコマンド、タイムアウト、レビュー基準における1ドルあたりの承認変更数です。

主な詳細

Grok 4.5はGrok Build、Cursor、およびAPIで利用可能です。低、中、高の推論モードをサポートしています。しかし、7月20日(The New Stack経由)のサードパーティテストでは、GrokとOpusをCursor Agentモードで同一の3つのRustタスクで実行しました:

  • バグ修正:両方とも最初のテストに合格。
  • 複数ファイルのリファクタリング:両方完了したが、Opusは1ファイル多く処理。
  • 機能構築(最も実践的なテスト):両方機能したが、Opusはテストカバレッジを追加し、マニュアルページのエントリを作成。

Opusの追加処理は、1ドルあたりの承認変更数に関係します。安価なモデルでも、追加の修正ループが必要ならコスト面で有利とは限りません。コミュニティでは、初回テスト合格率、修正回数、出力トークン数、経過時間、レビューアによる修正点の記録を推奨しています。

対象読者

Claude Code、Cursor、またはGrok Buildを使用してエージェントコーディングを行い、納品された変更の総コストを評価したい方。

📖 出典全文: r/ClaudeAI

Ad

👀 See Also

Claude Code v2.1.101では、チームオンボーディング機能の追加、エンタープライズTLSサポートの実装、メモリリークの修正が行われました。
News

Claude Code v2.1.101では、チームオンボーディング機能の追加、エンタープライズTLSサポートの実装、メモリリークの修正が行われました。

Claude Code v2.1.101では、チームメンバーのランプアップガイドを生成する/team-onboardingコマンドの追加、エンタープライズTLSプロキシ用のOS CA証明書ストアのデフォルト信頼設定、長いセッションでのメモリリーク修正など、25以上の改善とバグ修正が行われました。

OpenClawRadar
クロードオーパス4.7、ハンタウイルスワクチンに関する質問を安全リスクと判定しチャットを一時停止
News

クロードオーパス4.7、ハンタウイルスワクチンに関する質問を安全リスクと判定しチャットを一時停止

Claude Opus 4.7にハンタウイルスワクチンの開発方法を尋ねると、安全フィルターが作動してチャットが一時停止され、Sonnet 4.6でも関連する予測モデリングがブロックされる。

OpenClawRadar
非営利団体がチームおよびエンタープライズプランでClaude Opus 4.6にアクセス可能に
News

非営利団体がチームおよびエンタープライズプランでClaude Opus 4.6にアクセス可能に

チームおよびエンタープライズプランを利用している非営利団体は、Anthropicの最新AIモデル「Claude Opus 4.6」に追加費用なしでアクセスできるようになりました。

OpenClawRadar
ブルームバーグ、2026年のAIコーディングエージェントと生産性への懸念を報道
News

ブルームバーグ、2026年のAIコーディングエージェントと生産性への懸念を報道

2026年2月のブルームバーグの記事は、Claude CodeなどのAIコーディングエージェントについて論じ、テック業界における「生産性パニック」について報告しています。この記事はHacker Newsで44ポイントと14コメントを獲得しました。

OpenClawRadar