Grok 4.5 対 Claude Code: 1ドルあたりの承認済み変更数が真のベンチマーク
xAIが発表したGrok 4.5(DeepSWE 1.1で53%、Opus 4.8は59%、SWE Marathonのpass@1は29.0%対26.0%、トークン生成速度80 tokens/sec、入力$2/M、出力$6/M)は、単なるリーダーボードの主張ではなく、実用的なClaude Code比較として扱う価値があります。AIコーディングエージェントを使う開発者にとって重要な指標は、同じリポジトリ、プロンプト、ツール権限、テストコマンド、タイムアウト、レビュー基準における1ドルあたりの承認変更数です。
主な詳細
Grok 4.5はGrok Build、Cursor、およびAPIで利用可能です。低、中、高の推論モードをサポートしています。しかし、7月20日(The New Stack経由)のサードパーティテストでは、GrokとOpusをCursor Agentモードで同一の3つのRustタスクで実行しました:
- バグ修正:両方とも最初のテストに合格。
- 複数ファイルのリファクタリング:両方完了したが、Opusは1ファイル多く処理。
- 機能構築(最も実践的なテスト):両方機能したが、Opusはテストカバレッジを追加し、マニュアルページのエントリを作成。
Opusの追加処理は、1ドルあたりの承認変更数に関係します。安価なモデルでも、追加の修正ループが必要ならコスト面で有利とは限りません。コミュニティでは、初回テスト合格率、修正回数、出力トークン数、経過時間、レビューアによる修正点の記録を推奨しています。
対象読者
Claude Code、Cursor、またはGrok Buildを使用してエージェントコーディングを行い、納品された変更の総コストを評価したい方。
📖 出典全文: r/ClaudeAI
👀 See Also

Claude Code v2.1.101では、チームオンボーディング機能の追加、エンタープライズTLSサポートの実装、メモリリークの修正が行われました。
Claude Code v2.1.101では、チームメンバーのランプアップガイドを生成する/team-onboardingコマンドの追加、エンタープライズTLSプロキシ用のOS CA証明書ストアのデフォルト信頼設定、長いセッションでのメモリリーク修正など、25以上の改善とバグ修正が行われました。

クロードオーパス4.7、ハンタウイルスワクチンに関する質問を安全リスクと判定しチャットを一時停止
Claude Opus 4.7にハンタウイルスワクチンの開発方法を尋ねると、安全フィルターが作動してチャットが一時停止され、Sonnet 4.6でも関連する予測モデリングがブロックされる。

非営利団体がチームおよびエンタープライズプランでClaude Opus 4.6にアクセス可能に
チームおよびエンタープライズプランを利用している非営利団体は、Anthropicの最新AIモデル「Claude Opus 4.6」に追加費用なしでアクセスできるようになりました。

ブルームバーグ、2026年のAIコーディングエージェントと生産性への懸念を報道
2026年2月のブルームバーグの記事は、Claude CodeなどのAIコーディングエージェントについて論じ、テック業界における「生産性パニック」について報告しています。この記事はHacker Newsで44ポイントと14コメントを獲得しました。