IA escribió un motor PHP en Rust, pasa el 17% de las pruebas de PHP-src, renderiza WordPress

Alguien que no sabe Rust acaba de hacer que una IA construya un intérprete de PHP en ese lenguaje. El resultado, Phargo, sirve una página principal de WordPress de 26 KB desde una base de datos SQLite — a través de un motor que contiene cero líneas del código fuente real de PHP en C. Es un intérprete escrito desde cero en Rust, generado por un agente de IA donde el rol humano se reduce a: ejecutar pruebas, inspeccionar la puntuación, decir "continúa" o "ha empeorado, revisa de nuevo".
El experimento utiliza el propio conjunto de pruebas de PHP como un oráculo imparcial: unos 22,000 archivos .phpt acumulados durante 30 años, que cubren desde matemáticas de cambio de horario en DateTime hasta var_dump() en flotantes. Tasa de aprobación actual: 3,844 de 22,037 (17.4%). Como el conjunto incluye pruebas de extensiones C (GD, curl, SOAP, drivers MySQL) que están fuera del alcance, el techo realista es ~40-45%. El proyecto comenzó desde cero y avanza mediante histogramas de fallos: la IA identifica el grupo más grande de pruebas fallidas, implementa una corrección, ejecuta las 22,000 pruebas (~7 minutos), y confirma si el número sube — sin necesidad de revisión humana de código.
Lecciones desde la trinchera
El progreso inicial se estancó por un sutil error: los saltos de línea. El corpus de pruebas se descargó en Windows con finales CRLF, y el marcador comparaba la salida byte a byte, fallando silenciosamente en cada prueba multilínea. El propio ejecutor de pruebas de PHP normaliza antes de comparar. Una línea de código de normalización hizo que cientos de pruebas se volvieran verdes. La lección: mide tu medición — tu oráculo solo es tan honesto como el arnés que te conecta a él.
Otro descubrimiento: algunas pruebas de regresión antiguas asignan estructuras absurdas o se expanden en generadores infinitos, diseñadas originalmente para ejecutarse dentro del CI cuidadosamente cercado de PHP. Una de esas pruebas reinició forzosamente la máquina de desarrollo. El proyecto ahora filtra las pruebas que se sabe son bombas solo de CI.
El ciclo
- La IA ejecuta un histograma de fallos sobre todo el corpus para encontrar el grupo reparable más grande.
- La IA implementa la corrección.
- El marcador ejecuta las ~22,000 pruebas (~7 minutos).
- Si el número sube: confirmar, enviar, repetir.
- Si baja: el humano dice "mmh, ha empeorado, revisa de nuevo".
El trabajo del humano es esencialmente apuntar — leer la salida del terminal como un rey medieval revisando cartas navales, y luego escribir la frase más poderosa del desarrollador: "se ve bien, continúa".
📖 Lee la fuente completa: HN AI Agents
👀 Ver también

Claude Cowork unifica los comandos de barra y las habilidades bajo un único concepto.
Claude Cowork ha unificado los comandos de barra diagonal y las habilidades bajo un único concepto llamado 'habilidades', eliminando los encabezados separados en el menú /. Los comandos heredados continúan funcionando como antes.

OpenClaw: Sumérgete en el primer AMA en r/clawdbot
En una emocionante sesión de AMA, el equipo de OpenClaw discutió el futuro de los agentes de codificación de IA en el subreddit r/clawdbot de Reddit. Descubre las ideas clave y los puntos destacados de este evento interactivo.

Discusión en Reddit sobre los Riesgos a Largo Plazo de la Dependencia de Agentes de Codificación
Un usuario de Reddit argumenta que los agentes de codificación actuales como Claude Code y Copilot crean una dependencia que podría llevar a un encierro con proveedores, centralización de la creación de software y la mercantilización de la artesanía de la ingeniería.

Claude Code v2.1.158: Modo Auto ahora en Bedrock, Vertex, Foundry para Opus 4.7/4.8
Claude Code v2.1.158 habilita el modo automático en Bedrock, Vertex y Foundry para Opus 4.7 y 4.8. Actívalo con CLAUDE_CODE_ENABLE_AUTO_MODE=1.