Grok 4.5 対 Claude Code: 1ドルあたりの承認済み変更数が真のベンチマーク
xAIが発表したGrok 4.5(DeepSWE 1.1で53%、Opus 4.8は59%、SWE Marathonのpass@1は29.0%対26.0%、トークン生成速度80 tokens/sec、入力$2/M、出力$6/M)は、単なるリーダーボードの主張ではなく、実用的なClaude Code比較として扱う価値があります。AIコーディングエージェントを使う開発者にとって重要な指標は、同じリポジトリ、プロンプト、ツール権限、テストコマンド、タイムアウト、レビュー基準における1ドルあたりの承認変更数です。
主な詳細
Grok 4.5はGrok Build、Cursor、およびAPIで利用可能です。低、中、高の推論モードをサポートしています。しかし、7月20日(The New Stack経由)のサードパーティテストでは、GrokとOpusをCursor Agentモードで同一の3つのRustタスクで実行しました:
- バグ修正:両方とも最初のテストに合格。
- 複数ファイルのリファクタリング:両方完了したが、Opusは1ファイル多く処理。
- 機能構築(最も実践的なテスト):両方機能したが、Opusはテストカバレッジを追加し、マニュアルページのエントリを作成。
Opusの追加処理は、1ドルあたりの承認変更数に関係します。安価なモデルでも、追加の修正ループが必要ならコスト面で有利とは限りません。コミュニティでは、初回テスト合格率、修正回数、出力トークン数、経過時間、レビューアによる修正点の記録を推奨しています。
対象読者
Claude Code、Cursor、またはGrok Buildを使用してエージェントコーディングを行い、納品された変更の総コストを評価したい方。
📖 出典全文: r/ClaudeAI
👀 See Also

3ドルとゼロの人間ラベラーでClaude Haikuの96%まで微調整したQwen2.5-7B
開発者がQwen2.5-7Bを微調整し、ドメイン固有の意思決定タスクでClaude Haikuの96%の性能を達成。わずか3ドルのAPIコストと人間のラベラーゼロで実現した新手法DV-DPO。

Claude Code v2.1.132:SIGINTグレースフルシャットダウン、MCP修正、およびターミナル処理の全面改訂
Claude Code v2.1.132は、外部SIGINTでの正常なシャットダウンを修正し、CLAUDE_CODE_SESSION_IDおよびCLAUDE_CODE_DISABLE_ALTERNATE_SCREEN環境変数を追加し、MCPのメモリリークとツール一覧取得のリトライを修正し、IDE端末全体にわたる数十の端末エッジケースを解決しました。

2,181のリモートMCPサーバーエンドポイントの分析により、信頼性の問題が明らかになりました
2,181のリモート対応MCPサーバーエンドポイントを対象とした自動化されたヘルスチェックの結果、正常に稼働していることが確認されたのはわずか9%で、52%は完全にダウン、37%は認証が必要な状態であることが判明しました。データにはカテゴリー別の内訳、レイテンシー測定、稼働率統計が含まれています。

Claude Code v2.1.89では、遅延可能なフック、権限リトライ機能が追加され、メモリリークの問題が修正されました。
Claude Code v2.1.89では、PreToolUseフックに「defer」権限決定を導入し、再試行機能を備えたPermissionDeniedフックを追加、さらに大規模JSON入力でのメモリリークやStructuredOutputスキーマキャッシュの失敗など重大な問題を修正しました。