GPT-5.5 Codex 対 Claude Opus 4.7:実世界のコーディングエージェントベンチマーク

Redditユーザーが、GPT-5.5 Codex(Cursor経由)とClaude Opus 4.7(Claude Code)を、2つの本番レベルのタスクでテストしました。両方とも同じプロンプト、MCP(GitHub + Slack)、およびマシンを使用しています。結果は、コスト、アーキテクチャ、信頼性のトレードオフを浮き彫りにしています。
テスト1: PRトリアージボット
- GitHub MCP、スコアリング式、Slackアラート、リトライ、厳格なTypeScript(
any禁止)。 - Claude Code: コードを書く前にMCPが到達可能かを確認。36ファイルを12分で構築。独自のWebSocketスモークテストを記述(3msブロードキャスト)。初回実行でエラーゼロ。総コスト: 約$2.50。
- Codex: 失敗 — Cursor環境の問題でGitHub MCPに到達できず(モデルエラーではない)。タスクを完了できず。
テスト2: リアルタイムコードレビューUI
- React、WebSocket、楽観的ロールバック、仮想化diff、WS再接続。
- Claude Code: 同じくクリーンな納品、36ファイル、エラーなし。
- Codex: 28ファイルで出荷(よりコンパクトなアーキテクチャ)。Reactの無限ループに対して1つの手動パッチが必要。総コスト: 約$2.04(Claudeより18%安い)。
所見: 複雑でアーキテクチャ重視の作業では、Opus 4.7が依然としてリード — ツール処理が優れ、書き直し不要の出力、MCP検証も徹底。Codexはより軽量で安価であり、高速な出荷が重要で軽微なパッチを許容できる、タイトで自己完結型のタスクに適している。ユーザーはまだ乗り換えていないが、価格差に注目している。
📖 全文ソース: r/ClaudeAI
👀 See Also

CLAUDE.mdのルールから、シタデルによるインフラストラクチャー強制への移行
ある開発者が、CLAUDE.mdに約100行を超えるルールを追加すると、コンプライアンスが低下し、ファイル内に40%の冗長性があることを発見しました。解決策は、ライフサイクルフック、スキル、キャンペーンファイルを使用して、強制を指示からインフラストラクチャに移行することであり、最終的にはオープンソースのCitadelシステムが生まれました。

Claudeコード用カスタムステータスラインは、コンテキスト使用量、コスト、Gitブランチを表示します
Redditユーザーが、Claude CodeのstatusLine設定を活用して、コンテキストウィンドウの使用状況、セッションコスト、アクティブなモデル、現在のgitブランチなどのリアルタイム情報を表示するbashスクリプトを作成しました。このスクリプトにはjqが必要で、GitHubで公開されています。

Claude Codeによる.xcstringsの自動ローカライゼーション
新しいClaude Codeスキルが、Xcodeの.xcstringsファイルのローカライゼーションを5つのパイプラインステージ(ドメインスキャン、コメント生成、CLDR複数形を含む翻訳、文法チェック、複数形修正変換)で自動化します。

Google PMがSQLiteストレージ搭載の常時稼働メモリエージェントをオープンソース化、ベクトルDB不要
GoogleのシニアAIプロダクトマネージャーであるShubham Saboo氏が、ベクトルデータベースを使用せずに構造化されたメモリをSQLiteに保存する「Always On Memory Agent」をオープンソース化しました。このエージェントはGemini 3.1 Flash-Lite上で動作し、30分ごとにメモリ統合をスケジュール実行します。