なぜ大規模なPythonモノリスにおいてCodexが依然としてClaude Codeに勝るのか

過去1年間、複雑なPythonモノリスに取り組む開発者は主にCodexを使用してきた。Opus 4.6と4.7を搭載したClaude Codeを1ヶ月テストした後も、このコードベースではCodexを好んでいる。このアプリケーションは単純なCRUDサーバーではなく、新しいDDD風のレイヤー、古くても構造化されたコード、そして脆弱なレガシースパゲッティコードが混在している。チームは、必要がない限り古い部分の書き換えを避けている。
Codexの主な利点
- ハーネスエンジニアリングの原則: Codexは、明示的な指示がなくても ハーネスエンジニアリングのワークフロー を確実に遵守する。Claudeは、
AGENTS.mdに「exec_plan.mdを読んで従え」といった指示が含まれている場合のみそうする。 - 既存のツールとパターンを再利用: Claudeは、コードベースで既存のものを検索する代わりに、新しいツールを作成することが多い。プロジェクト固有のヘルパーが多いコードベースでは、再利用が重要である。
- 優れた計画性とコンテキスト認識: Claudeは、新しい機能を配置する前に読む量が少なすぎることがよくある。開発者は何度も次のように修正しなければならなかった。
「この機能はコントローラーではなく、モジュールAに配置してください。」
「リクエストで送信したステータスを使ってレスポンスオブジェクトを構築しないでください。APIは既に更新されたオブジェクトを返しています。そのレスポンスを使用してください。」
「この境界を所有する同じモジュールで検証してください。」
Codexは、アーキテクチャの変更を行う前に、欠落しているコンテキストに気づき、質問を明確にすることがより頻繁にある。
Claudeが優れている点
フロントエンド作業では、Opus 4.6はCodex 5.3やGPT-5.4よりも はるかに優れていた。現在、開発者はUIタスクではClaudeを好んでいる。GPT-5.5はUI中心の作業ではまだテストしていない。
ツール設定
両方のLLMは、Docker Composeの起動と停止、およびコンテナ内でテストを実行するためのコマンドという、1つの共有スキルを使用している。
これはベンチマークではなく、1つの本番コードベースでの日常的な使用経験です。
📖 全文を読む: HN AI Agents
👀 See Also

OpenClaw Reactクライアントのアップデートで、エージェントごとのモデル、CLIツール、自動起動機能が追加されました
オープンソースのOpenClawクライアントが、エージェントごとのモデル割り当て、自動更新、管理用の新しいCLIツール、システム再起動後の自動起動という4つの主要機能を備えた大幅なアップデートを受けました。

ゼロドリフトのためのフェンスドブロックを使用した自己維持ドキュメントシステム
ある開発者が、ソースファイルから構造化データを直接抽出し、HTMLコメントブロックで囲まれた領域を通じてCLAUDE.mdに注入するbashスクリプトを作成しました。これにより、手動でのメンテナンスなしに、ドキュメントがコードと同期し続けることが保証されます。

TechDebtMCP v2.0.0:14言語にわたる技術的負債分析のためのMCPサーバー
TechDebtMCP v2.0.0は、Claudeをコードベースに接続して、JS/TS、Python、Java、Swift、Kotlin、Go、Rust、C/C++、C#、Ruby、PHPを含む14のプログラミング言語にわたる技術的負債を発見、測定、優先順位付けするMCPサーバーです。
ローカルファーストMarkdownメモリサーバー(AIエージェント向け)の調査:Mem0、Hindsight、Zep、そして新参者Engram
あるユーザーが、編集可能なファイルとして記憶を保存するためのローカルエージェントメモリシステムを約20個テストしました。Engram(Obsidian68製)だけが、完全ローカル、Markdown保存、スマート重複除去、重要度減衰、スタンドアロンサーバーのすべての要件を満たしました。