Grok 4.5 対 Claude Code: 1ドルあたりの承認済み変更数が真のベンチマーク
xAIが発表したGrok 4.5(DeepSWE 1.1で53%、Opus 4.8は59%、SWE Marathonのpass@1は29.0%対26.0%、トークン生成速度80 tokens/sec、入力$2/M、出力$6/M)は、単なるリーダーボードの主張ではなく、実用的なClaude Code比較として扱う価値があります。AIコーディングエージェントを使う開発者にとって重要な指標は、同じリポジトリ、プロンプト、ツール権限、テストコマンド、タイムアウト、レビュー基準における1ドルあたりの承認変更数です。
主な詳細
Grok 4.5はGrok Build、Cursor、およびAPIで利用可能です。低、中、高の推論モードをサポートしています。しかし、7月20日(The New Stack経由)のサードパーティテストでは、GrokとOpusをCursor Agentモードで同一の3つのRustタスクで実行しました:
- バグ修正:両方とも最初のテストに合格。
- 複数ファイルのリファクタリング:両方完了したが、Opusは1ファイル多く処理。
- 機能構築(最も実践的なテスト):両方機能したが、Opusはテストカバレッジを追加し、マニュアルページのエントリを作成。
Opusの追加処理は、1ドルあたりの承認変更数に関係します。安価なモデルでも、追加の修正ループが必要ならコスト面で有利とは限りません。コミュニティでは、初回テスト合格率、修正回数、出力トークン数、経過時間、レビューアによる修正点の記録を推奨しています。
対象読者
Claude Code、Cursor、またはGrok Buildを使用してエージェントコーディングを行い、納品された変更の総コストを評価したい方。
📖 出典全文: r/ClaudeAI
👀 See Also

PS3エミュレータ開発者、AI生成のPRを送らないよう要請
RPCS3のメンテナーは、AIコードエージェントによって生成されたプルリクエストの提出をユーザーに控えるよう公に要請しました。品質の低さとメンテナンスの負担が理由です。

Claude Code v2.1.89では、遅延可能なフック、権限リトライ機能が追加され、メモリリークの問題が修正されました。
Claude Code v2.1.89では、PreToolUseフックに「defer」権限決定を導入し、再試行機能を備えたPermissionDeniedフックを追加、さらに大規模JSON入力でのメモリリークやStructuredOutputスキーマキャッシュの失敗など重大な問題を修正しました。

ハッカー・ニュースのAI議論、デモからツール開発へと焦点が移行
最近のHacker NewsにおけるAIに関する議論は、単発的なデモから、価格追跡、検証、メモリ、評価、ワークフロー統合といった持続可能なツールへと移行しています。これは、コミュニティが新奇性重視の投稿を評価しなくなる運用化への移行を示すシグナルです。

ジェンセン・フアンのGTC 2026におけるOpenClaw主張とNVIDIAの戦略の分析
NVIDIA CEO ジェンセン・フアンのGTC 2026基調講演におけるOpenClawの成長、エージェントのセキュリティリスク、NVIDIA独自ソリューションに関する主張のファクトチェック。情報源は技術的根拠を検証しつつ、NVIDIAのビジネス戦略を分析しています。