AIがRustでPHPエンジンを開発、PHP-srcテストの17%を通過しWordPressをレンダリング

✍️ OpenClawRadar📅 公開日: July 5, 2026🔗 Source
AIがRustでPHPエンジンを開発、PHP-srcテストの17%を通過しWordPressをレンダリング
Ad

Rustを知らない人物が、AIにPHPインタプリタをRustで構築させました。その結果であるPhargoは、SQLiteデータベースから26KBのWordPressトップページを提供します——PHPの実際のCソースコードを一行も含まないエンジンを介して。これはRustで書かれたゼロからのインタプリタであり、AIエージェントによって生成され、人間の役割は次のように縮小されました:テストを実行し、スコアを確認し、「続行」または「後退した、もう一度確認」と言うだけです。

この実験では、PHP自身のテストスイートを公平な判断基準として使用しています:30年間に蓄積された約22,000の.phptファイルで、DateTimeの夏時間計算から浮動小数点数のvar_dump()までをカバーしています。現在の合格率:22,037中3,844(17.4%)。スイートにはスコープ外のC拡張テスト(GD、curl、SOAP、MySQLドライバ)が含まれているため、現実的な上限は約40〜45%です。プロジェクトはゼロから始まり、失敗ヒストグラムを通じて上昇します:AIは最も大きな失敗テストのクラスタを特定し、修正を実装し、全22,000テストを実行し(約7分)、数値が上がればコミットします——人間のコードレビューは不要です。

Ad

実戦からの教訓

初期の進捗は、微妙なバグによって停滞しました:改行コードです。テストコーパスがWindows上でCRLF改行でチェックアウトされ、スコアボードは出力をバイト単位で比較していたため、複数行のテストがすべて黙って失敗しました。PHPのテストランナーは比較前に正規化します。1行の正規化コードで数百のテストがパスするようになりました。教訓:測定方法を測定せよ——判断基準は、それを接続するハーネスと同じくらい正直でしかありません。

もう一つの発見:一部の古い回帰テストは、異常な構造を割り当てたり、無限ジェネレータに展開したりします。これらはもともとPHPの注意深くフェンスされたCI内で実行されるように設計されていました。そのようなテストの1つが開発マシンをハードリスタートさせました。現在、プロジェクトは既知のCI専用爆弾テストをフィルタリングしています。

ループ

  • AIが全コーパスに対して失敗ヒストグラムを実行し、修正可能な最大のクラスタを見つける。
  • AIが修正を実装する。
  • スコアボードが全22,000テストを実行する(約7分)。
  • 数値が上がれば:コミット、プッシュ、繰り返し。
  • 下がれば:人間が「うーん、後退した、もう一度確認」と言う。

人間の仕事は基本的に方向付けです——ターミナル出力を中世の王が海図を確認するように読み、そして開発者にとって最も強力なフレーズ「よさそうだ、続けよう」とタイプすることです。

📖 全文ソース: HN AI Agents

Ad

👀 See Also

ピアゼロ:信頼性に基づくインセンティブでAIエージェントがピアレビューを実施
News

ピアゼロ:信頼性に基づくインセンティブでAIエージェントがピアレビューを実施

PeerZeroは、AIエージェントが研究論文を提出し、互いの研究を査読し、バウンティシステムを通じて正しさに信頼性を賭けるプラットフォームです。エージェントは査読の正確性に基づいて信頼性スコアを獲得または失い、独立した思考を報い、集団思考を罰する「正当化されたアウトライアー」メカニズムを備えています。

OpenClawRadar
オーケストレーター:なぜ意図がプロセスを超えて存続すべきか
News

オーケストレーター:なぜ意図がプロセスを超えて存続すべきか

現在のエージェントスタックはアイデンティティとサーフェスを逆転させている——オーケストレーション層はエージェントとランタイムの間に位置し、アイデンティティ、ルーティング、ハンドオフプリミティブ、クロスドライバー呼び出しを提供すべきである。実例:単一のインテントでOllama、Gemini CLI、Grok Buildを横断して不安定なテストをトリアージする。

OpenClawRadar
Claudeデザインの請求バグ:追加利用購入が適用されず、サポートボットが有料ユーザーを閉じ込める
News

Claudeデザインの請求バグ:追加利用購入が適用されず、サポートボットが有料ユーザーを閉じ込める

Claude Designユーザーがアプリ内課金で20ドルを支払ったが、クレジットがClaude Designの別個の利用制限に適用されない。サポートボットのFinが問題を誤解し、無関係な応答を繰り返し、新規チケットをブロックし、人間へのエスカレーションがない。

OpenClawRadar
Anthropic、Claude AIエージェントに関連するコード流出に対応
News

Anthropic、Claude AIエージェントに関連するコード流出に対応

Anthropicは、Claude AIエージェントに関連するコードの流出に対処していると、Hacker Newsで13ポイントと6コメントを集めたWSJの記事が報じています。

OpenClawRadar