KI schrieb eine PHP-Engine in Rust, besteht 17 % der PHP-src-Tests, rendert WordPress

Jemand, der kein Rust kann, hat von einer KI einen PHP-Interpreter in Rust bauen lassen. Das Ergebnis, Phargo, serviert eine 26 KB große WordPress-Startseite aus einer SQLite-Datenbank – mit einer Engine, die null Zeilen des eigentlichen PHP-C-Quellcodes enthält. Es ist ein von Grund auf neu geschriebener Interpreter in Rust, generiert von einem KI-Agenten, dessen menschliche Rolle reduziert ist auf: Tests ausführen, Ergebnisse prüfen, „weiter“ oder „verschlechtert, nochmal prüfen“ sagen.
Das Experiment nutzt PHP’s eigene Testsuite als unparteiisches Orakel: ~22.000 .phpt-Dateien, die über 30 Jahre angesammelt wurden, und decken alles ab, von DateTime-Sommerzeitberechnungen bis zu var_dump() auf Fließkommazahlen. Aktuelle Bestehensquote: 3.844 von 22.037 (17,4 %). Da die Suite C-Erweiterungstests (GD, curl, SOAP, MySQL-Treiber) enthält, die außerhalb des Rahmens liegen, liegt die realistische Obergrenze bei ~40-45 %. Das Projekt startete bei Null und steigt durch Fehlerhistogramme: Die KI identifiziert den größten Cluster fehlschlagender Tests, implementiert eine Korrektur, führt die gesamte 22.000-Test-Suite aus (~7 Minuten) und committet, wenn die Zahl steigt – keine menschliche Code-Überprüfung nötig.
Lehren aus der Praxis
Frühe Fortschritte stagnierten aufgrund eines subtilen Fehlers: Zeilenenden. Das Testkorpus wurde unter Windows mit CRLF-Endungen ausgecheckt, und die Anzeige verglich die Ausgabe Byte für Byte, wodurch jeder mehrzeilige Test stillschweigend fehlschlug. PHP’s eigener Test-Runner normalisiert vor dem Vergleich. Eine Zeile Normalisierungscode ließ hunderte Tests grün werden. Die Lehre: Messe deine Messung – dein Orakel ist nur so ehrlich wie die Testumgebung, die dich damit verbindet.
Eine weitere Entdeckung: Einige ältere Regressionstests allozieren absurde Strukturen oder expandieren zu unendlichen Generatoren, ursprünglich entwickelt, um in PHP’s sorgfältig abgeschirmtem CI zu laufen. Ein solcher Test startete den Entwicklungsrechner hart neu. Das Projekt filtert nun Tests, die als CI-only-Bomben bekannt sind.
Der Kreislauf
- KI erstellt ein Fehlerhistogramm über das gesamte Korpus, um den größten behebbaren Cluster zu finden.
- KI implementiert die Korrektur.
- Anzeige führt alle ~22.000 Tests aus (~7 Minuten).
- Wenn die Zahl steigt: commit, push, wiederholen.
- Wenn sie fällt: Mensch sagt „hmm, das hat sich verschlechtert, nochmal prüfen.“
Die Aufgabe des Menschen besteht im Wesentlichen im Zielen – Terminal-Ausgabe lesen wie ein mittelalterlicher König, der Seekarten überprüft, und dann die mächtigste Phrase des Entwicklers tippen: „sieht gut aus, weiter.“
📖 Vollständige Quelle lesen: HN AI Agents
👀 Siehe auch

MiniMax M2.7 Modell veröffentlicht mit verbesserter Codierleistung
MiniMax hat M2.7 veröffentlicht, ein KI-Modell, das 56 % in den SWE-Pro-Coding-Benchmarks erreicht und Selbstoptimierungsfähigkeiten beinhaltet. Das Modell behält den Preis von 0,30 US-Dollar pro Million Eingabe-Tokens bei.

OpenClaw-Treffen in Peking lockt zahlreiches technisches Publikum an
Ein OpenClaw-Meetup in Peking war bis auf den letzten Platz gefüllt, wobei Entwickler detaillierte Fragen zu Multi-Agenten-Orchestrierung, autonomen Schleifen und privaten Bereitstellungen stellten. Das Publikum war besonders auf eine Demo fokussiert, die zeigte, wie Planner-, Developer- und Verifier-Agenten autonom zusammenarbeiten, um ein Ein-Personen-Unternehmen zu betreiben.

Qwen3.5-122B auf Blackwell SM120: fp8-KV-Cache-Korruptionsproblem und Leistungsbefunde
Tests von Qwen3.5-122B auf 8x RTX PRO 6000 Blackwell-Hardware ergaben, dass der fp8_e4m3-KV-Cache stillschweigend fehlerhafte Ausgaben ohne Fehlermeldungen erzeugt, sodass stattdessen ein bf16-KV-Cache erforderlich ist. Die MTP-Optimierung brachte eine 2,75-fache Beschleunigung bei Einzelanfragen, während DeltaNet-Einschränkungen andere Optimierungen blockierten.

Die KI-Ping-Pong: Wenn jede Antwort ein ChatGPT-Screenshot ist
Entwickler berichten, dass sie mit KI-generierten Antworten überschwemmt werden – von Kollegen, Chefs und sogar GitHub-Kommentatoren – die den Kontext ignorieren und Zeit verschwenden. Die HN-Diskussion zeigt eine wachsende Frustration.