Un moteur PHP écrit en Rust par une IA passe 17 % des tests de PHP-src et exécute WordPress

Quelqu'un qui ne connaît pas Rust vient de faire construire par une IA un interpréteur PHP dans ce langage. Le résultat, Phargo, sert une page d'accueil WordPress de 26 Ko depuis une base de données SQLite — via un moteur ne contenant aucune ligne du code source C de PHP. C'est un interpréteur écrit de zéro en Rust, généré par un agent IA dont le rôle humain se limite à : exécuter les tests, inspecter le score, dire « continue » ou « régression, regarde à nouveau ».
L'expérience utilise la propre suite de tests de PHP comme oracle impartial : environ 22 000 fichiers .phpt accumulés sur 30 ans, couvrant tout, des calculs de changement d'heure (DateTime) à var_dump() sur des flottants. Taux de réussite actuel : 3 844 sur 22 037 (17,4 %). Comme la suite inclut des tests d'extensions C (GD, curl, SOAP, pilotes MySQL) hors périmètre, le plafond réaliste est d'environ 40-45 %. Le projet a commencé à zéro et progresse via des histogrammes d'échecs : l'IA identifie le plus gros groupe de tests en échec, implémente une correction, exécute la suite complète de 22 000 tests (~7 minutes), et valide si le nombre augmente — sans relecture humaine de code.
Leçons du terrain
Les premiers progrès ont plafonné à cause d'un bug subtil : les fins de lignes. Le corpus de tests a été extrait sous Windows avec des fins CRLF, et le comparateur comparait la sortie octet par octet, échouant silencieusement chaque test multiligne. Le propre lanceur de tests de PHP normalise avant la comparaison. Une ligne de code de normalisation a rendu verts des centaines de tests. La leçon : mesurez votre mesure — votre oracle n'est aussi honnête que le harnais qui vous y relie.
Une autre découverte : certains tests de régression plus anciens allouent des structures absurdes ou se développent en générateurs infinis, conçus à l'origine pour s'exécuter dans le CI soigneusement cloisonné de PHP. L'un de ces tests a redémarré brutalement la machine de développement. Le projet filtre désormais les tests connus comme étant des bombes CI-only.
La boucle
- L'IA exécute un histogramme d'échecs sur tout le corpus pour trouver le plus gros groupe corrigible.
- L'IA implémente la correction.
- Le comparateur exécute tous les ~22 000 tests (~7 minutes).
- Si le nombre augmente : commit, push, répète.
- S'il diminue : l'humain dit « hum, ça a régressé, regarde à nouveau. »
Le travail de l'humain consiste essentiellement à viser — lire la sortie du terminal comme un roi médiéval examinant des cartes navales, puis taper la phrase la plus puissante du développeur : « semble bon, continue. »
📖 Lire la source complète : HN AI Agents
👀 See Also

Accord de calcul Anthropic-xAI : Au-delà des limites de Claude Code
Anthropic a signé un accord de 300 MW / 220 000 GPU avec son concurrent xAI. Cela signale un resserrement de l'offre de GPU et un partage structurel des ressources de calcul entre laboratoires, avec des implications pour la tarification de l'inférence et le routage multi-fournisseurs.

Les PDG rapportent un impact minimal de l'IA sur la productivité et l'emploi dans une étude récente
Une étude portant sur 6 000 cadres dirigeants a révélé que 90 % d'entre eux n'ont signalé aucun impact de l'IA sur l'emploi ou la productivité sur trois ans, avec une utilisation moyenne de l'IA de 1,5 heure par semaine. Les économistes comparent cela au paradoxe de productivité de Solow de l'ère informatique des années 1980.

Claude d'Anthropic mène 80 000 entretiens structurés en alternative aux enquêtes
Anthropic a utilisé Claude pour mener des entretiens structurés avec environ 80 000 utilisateurs dans plus de 150 pays et 70 langues, le LLM servant à la fois d'intervieweur et d'analyste pour recueillir des informations conversationnelles.

Agents IA recrutant d'autres agents IA : des travailleurs solitaires aux économies en réseau
Un post sur Reddit soutient que les agents d'IA passeront d'outils isolés à des travailleurs en réseau qui délèguent des tâches, se spécialisent, bâtissent une réputation et échangent de la valeur — déplaçant le problème difficile de l'intelligence vers la coordination.