Un moteur PHP écrit en Rust par une IA passe 17 % des tests de PHP-src et exécute WordPress

Quelqu'un qui ne connaît pas Rust vient de faire construire par une IA un interpréteur PHP dans ce langage. Le résultat, Phargo, sert une page d'accueil WordPress de 26 Ko depuis une base de données SQLite — via un moteur ne contenant aucune ligne du code source C de PHP. C'est un interpréteur écrit de zéro en Rust, généré par un agent IA dont le rôle humain se limite à : exécuter les tests, inspecter le score, dire « continue » ou « régression, regarde à nouveau ».
L'expérience utilise la propre suite de tests de PHP comme oracle impartial : environ 22 000 fichiers .phpt accumulés sur 30 ans, couvrant tout, des calculs de changement d'heure (DateTime) à var_dump() sur des flottants. Taux de réussite actuel : 3 844 sur 22 037 (17,4 %). Comme la suite inclut des tests d'extensions C (GD, curl, SOAP, pilotes MySQL) hors périmètre, le plafond réaliste est d'environ 40-45 %. Le projet a commencé à zéro et progresse via des histogrammes d'échecs : l'IA identifie le plus gros groupe de tests en échec, implémente une correction, exécute la suite complète de 22 000 tests (~7 minutes), et valide si le nombre augmente — sans relecture humaine de code.
Leçons du terrain
Les premiers progrès ont plafonné à cause d'un bug subtil : les fins de lignes. Le corpus de tests a été extrait sous Windows avec des fins CRLF, et le comparateur comparait la sortie octet par octet, échouant silencieusement chaque test multiligne. Le propre lanceur de tests de PHP normalise avant la comparaison. Une ligne de code de normalisation a rendu verts des centaines de tests. La leçon : mesurez votre mesure — votre oracle n'est aussi honnête que le harnais qui vous y relie.
Une autre découverte : certains tests de régression plus anciens allouent des structures absurdes ou se développent en générateurs infinis, conçus à l'origine pour s'exécuter dans le CI soigneusement cloisonné de PHP. L'un de ces tests a redémarré brutalement la machine de développement. Le projet filtre désormais les tests connus comme étant des bombes CI-only.
La boucle
- L'IA exécute un histogramme d'échecs sur tout le corpus pour trouver le plus gros groupe corrigible.
- L'IA implémente la correction.
- Le comparateur exécute tous les ~22 000 tests (~7 minutes).
- Si le nombre augmente : commit, push, répète.
- S'il diminue : l'humain dit « hum, ça a régressé, regarde à nouveau. »
Le travail de l'humain consiste essentiellement à viser — lire la sortie du terminal comme un roi médiéval examinant des cartes navales, puis taper la phrase la plus puissante du développeur : « semble bon, continue. »
📖 Lire la source complète : HN AI Agents
👀 See Also
Régression d'OpenClaw 2026.8.2 : l'agent ne publie plus de tokens et préfère la recherche native de X aux compétences personnalisées
Un utilisateur de longue date d'OpenClaw rétrograde pour la première fois depuis ses débuts début 2026, après que la version 2026.8.2 a poussé l'agent à refuser de relayer des jetons à usage unique dans Telegram et à privilégier un outil de recherche X natif plutôt que des compétences personnalisées.

L'IA n'a pas supprimé votre base de données — c'est vous : Responsabilité à l'ère des agents de codage IA
Une histoire virale accusait un agent IA d'avoir supprimé une base de données de production, mais le vrai problème est l'exposition de points d'accès destructeurs et le manque de processus—pas l'outil.

Anthropic restreint les abonnements à Claude via des plateformes tierces comme OpenClaw.
Anthropic met fin à la couverture des abonnements Claude pour les interfaces tierces, y compris OpenClaw, à partir du 4 avril. Les utilisateurs devront activer une facturation à l'usage supplémentaire facturée séparément, avec un crédit unique équivalent au prix de l'abonnement mensuel disponible jusqu'au 17 avril.

Claude Code Opus échoue avec une erreur de limite de débit malgré la capacité hebdomadaire disponible
Un abonné Claude Max signale que Claude Code Opus renvoie 'Erreur API : Limite de débit atteinte' alors que son tableau de bord d'utilisation indique que 97 % de sa capacité hebdomadaire 'Tous modèles' reste inutilisée. Le problème se produit spécifiquement dans Claude Code alors qu'Opus fonctionne normalement sur claude.ai depuis le même compte.