IA escribió un motor PHP en Rust, pasa el 17% de las pruebas de PHP-src, renderiza WordPress

Alguien que no sabe Rust acaba de hacer que una IA construya un intérprete de PHP en ese lenguaje. El resultado, Phargo, sirve una página principal de WordPress de 26 KB desde una base de datos SQLite — a través de un motor que contiene cero líneas del código fuente real de PHP en C. Es un intérprete escrito desde cero en Rust, generado por un agente de IA donde el rol humano se reduce a: ejecutar pruebas, inspeccionar la puntuación, decir "continúa" o "ha empeorado, revisa de nuevo".
El experimento utiliza el propio conjunto de pruebas de PHP como un oráculo imparcial: unos 22,000 archivos .phpt acumulados durante 30 años, que cubren desde matemáticas de cambio de horario en DateTime hasta var_dump() en flotantes. Tasa de aprobación actual: 3,844 de 22,037 (17.4%). Como el conjunto incluye pruebas de extensiones C (GD, curl, SOAP, drivers MySQL) que están fuera del alcance, el techo realista es ~40-45%. El proyecto comenzó desde cero y avanza mediante histogramas de fallos: la IA identifica el grupo más grande de pruebas fallidas, implementa una corrección, ejecuta las 22,000 pruebas (~7 minutos), y confirma si el número sube — sin necesidad de revisión humana de código.
Lecciones desde la trinchera
El progreso inicial se estancó por un sutil error: los saltos de línea. El corpus de pruebas se descargó en Windows con finales CRLF, y el marcador comparaba la salida byte a byte, fallando silenciosamente en cada prueba multilínea. El propio ejecutor de pruebas de PHP normaliza antes de comparar. Una línea de código de normalización hizo que cientos de pruebas se volvieran verdes. La lección: mide tu medición — tu oráculo solo es tan honesto como el arnés que te conecta a él.
Otro descubrimiento: algunas pruebas de regresión antiguas asignan estructuras absurdas o se expanden en generadores infinitos, diseñadas originalmente para ejecutarse dentro del CI cuidadosamente cercado de PHP. Una de esas pruebas reinició forzosamente la máquina de desarrollo. El proyecto ahora filtra las pruebas que se sabe son bombas solo de CI.
El ciclo
- La IA ejecuta un histograma de fallos sobre todo el corpus para encontrar el grupo reparable más grande.
- La IA implementa la corrección.
- El marcador ejecuta las ~22,000 pruebas (~7 minutos).
- Si el número sube: confirmar, enviar, repetir.
- Si baja: el humano dice "mmh, ha empeorado, revisa de nuevo".
El trabajo del humano es esencialmente apuntar — leer la salida del terminal como un rey medieval revisando cartas navales, y luego escribir la frase más poderosa del desarrollador: "se ve bien, continúa".
📖 Lee la fuente completa: HN AI Agents
👀 Ver también

Minions de Stripe: Agentes de Codificación AI de Una Sola Toma
Los Minions son los agentes de codificación impulsados por IA de Stripe que buscan mejorar la productividad de los desarrolladores aprovechando la automatización de extremo a extremo mediante LLMs.

Claude 4.6 Pensamiento Adaptativo: Usuario de Reddit Informa Desperdicio de Tokens y Proporciona Comandos de Desactivación
Un usuario de Reddit informa que la nueva función de pensamiento adaptativo de Claude 4.6 puede desperdiciar tokens y agregar latencia en Claude Code, proporcionando comandos de shell para desactivarla o limitar los tokens de pensamiento.

Claude Code v2.1.152: /code-review --fix, plugin desactivado, hook MessageDisplay
Claude Code v2.1.152 introduce /code-review --fix para aplicar sugerencias a tu árbol de trabajo, /reload-skills, hook MessageDisplay y herramientas no permitidas en plugins en frontmatter. También corrige la degradación del estilo en sesiones largas, deduplicación MCP y reporte de caché.

Claude Code v2.1.154: Opus 4.8, Flujos de Trabajo Dinámicos y Principales Correcciones
Nueva versión añade Opus 4.8 con predeterminados de alto esfuerzo, flujos de trabajo dinámicos que orquestan decenas a cientos de agentes, modo rápido al doble de tarifa por 2.5 veces la velocidad, y más de una docena de correcciones de errores.