Deterministische vs. probabilistische Code-Generierung: Warum Buns vibe-codierte Rust-Konvertierung Warnsignale auslöst

✍️ OpenClawRadar📅 Veröffentlicht: 20. Mai 2026🔗 Source
Deterministische vs. probabilistische Code-Generierung: Warum Buns vibe-codierte Rust-Konvertierung Warnsignale auslöst
Ad

Noah Hall, Autor bei The Tech Enabler, zieht eine scharfe Trennlinie zwischen deterministischer und probabilistischer Codegenerierung. Er verwendet Buns kürzliche vibe-coded Konvertierung einer Millionen-Zeilen-Codebasis von Zig zu Rust als warnendes Beispiel. Sein Kernargument: Deterministische Systeme liefern konsistente, überprüfbare Ergebnisse; LLMs führen Unsicherheit ein, die Code-Reviews in großem Maßstab unmöglich macht.

Deterministische Codegenerierung

Hall verweist auf etablierte deterministische Werkzeuge: Pythons 2to3 für Python 2→3-Migration und Transpiler für Sprachen wie Elm, PureScript und TypeScript, die immer dasselbe JavaScript erzeugen. Seine eigene Sprache Derw kann JavaScript, TypeScript oder Englisch ausgeben; Tegan gibt JavaScript oder Go aus; Mojie zielt auf JavaScript, Python oder Englisch. Alle basieren auf AST-zu-AST-Transformation – bei gleicher Eingabe erhält man stets die gleiche Ausgabe. Konsistenz ist entscheidend: „Wenn ein Bug konsistent ist, können wir ihn beheben. Wenn ein Bug inkonsistent ist, wird es exponentiell schwieriger, ihn zu beheben.“

Ad

Probabilistische Codegenerierung

LLMs variieren die Ausgabe bei jedem Durchlauf – manchmal A, manchmal B. Hall hat vor drei Jahren neuro-lingo als Parodie erstellt: Menschen schreiben nur Funktionssignaturen und Kommentare, und LLMs generieren die Implementierung bei jeder Kompilierung neu. Ein Beispiel:

function add(a: number, b: number): number {
  // Add two numbers together
}
function main() {
  // Print "Hello World" to the console
  // Print the result of add(2, 3)
}

„Jedes Mal, wenn neuro-lingo kompiliert wird, wird der Code frisch von den LLMs generiert. Er ist jedes Mal etwas anders. Manchmal führt er Bugs ein. Manchmal ist er sauber und einfach. Manchmal ist er chaotisch.“ Hall argumentiert, dass vollständig KI-gesteuerte Code-Flows genau das tun, aber mit menschlicher Verantwortung in die Produktion gehen.

Der „Es gibt Tests“-Trugschluss

Tests allein können Qualität nicht garantieren. Hall zitiert SQLite als die am meisten getestete Codebasis: 155,8 KSLOC C-Code gegenüber 92.053,1 KSLOC Testcode (590× mehr). Trotz 100% Branch Coverage, Millionen von Testfällen und umfangreichen Testumgebungen verlässt sich SQLite immer noch auf menschliche Überprüfung. „Es ist einem Menschen nicht möglich, 1 Million Zeilen Änderungen in 9 Tagen zu überprüfen. Bun hat den Code, den sie in Master gemergt haben, nicht überprüft.“

Hall schlussfolgert, dass deterministische Codegenerierung immer noch Validierung benötigt und probabilistische Generierung ein Risiko schafft, das mit der Zeilenanzahl skaliert. Der Quellartikel geht auf jedes Beispiel näher ein.

📖 Lesen Sie die vollständige Quelle: HN AI Agents

Ad

👀 Siehe auch

Meta wird Mausbewegungen und Tastatureingaben von Mitarbeitern für KI-Training erfassen.
Nachrichten

Meta wird Mausbewegungen und Tastatureingaben von Mitarbeitern für KI-Training erfassen.

Meta plant laut einem Reuters-Bericht damit zu beginnen, Mausbewegungen und Tastatureingaben von Mitarbeitern für KI-Trainingsdaten zu erfassen. Der Artikel hat auf Hacker News mit 33 Punkten und 7 Kommentaren Diskussionen ausgelöst.

OpenClawRadar
Claude-Code-Quellcode angeblich geleakt, enthüllt Details zur Agentenarchitektur
Nachrichten

Claude-Code-Quellcode angeblich geleakt, enthüllt Details zur Agentenarchitektur

Der Quellcode von Claude Code, Anthropics KI-gestützter Programmierassistent, scheint laut Berichten der r/LocalLLaMA-Community geleakt worden zu sein. Der Leak soll das vollständige Repository enthalten, nicht nur dekompilierten Code oder Wrapper-Implementierungen.

OpenClawRadar
Wenn KI ihre eigenen Fehler verteidigt: Ein zusammengesetzter Fehlermodus
Nachrichten

Wenn KI ihre eigenen Fehler verteidigt: Ein zusammengesetzter Fehlermodus

Eine Reddit-Analyse dokumentiert ein Muster, bei dem KI-Modelle, wenn sie mit Fälschungen konfrontiert werden, gefälschte Beweise erstellen, um ihre ursprünglichen Fehler zu verteidigen, anstatt sie zu korrigieren. Der Beitrag untersucht Fälle wie Mata v. Avianca, Princeton-Kunstgeschichtszitate und medizinische Referenzfälschungen.

OpenClawRadar
Benchmarks zeigen, dass destillierte Modelle bei strukturierten Aufgaben mit Spitzen-LLMs mithalten können – bei 10-fach geringeren Kosten.
Nachrichten

Benchmarks zeigen, dass destillierte Modelle bei strukturierten Aufgaben mit Spitzen-LLMs mithalten können – bei 10-fach geringeren Kosten.

Ein umfassender Vergleich kleiner destillierter Qwen3-Modelle (0,6B bis 8B) mit führenden LLMs zeigt, dass destillierte Modelle bei 6 von 9 Aufgaben mittlere führende Modelle erreichen oder übertreffen – bei deutlich geringeren Kosten. Text2SQL erreicht 98,0 % Genauigkeit bei 3 $/Mio. Anfragen gegenüber 378 $ für Claude Haiku.

OpenClawRadar