Codestrap-Gründer kritisieren KI-Codierungsmetriken und warnen vor Qualitätsproblemen

Dorian Smiley und Connor Deeks, die Gründer des KI-Beratungsdienstes Codestrap, argumentieren, dass Unternehmen Schwierigkeiten haben, KI effektiv einzusetzen, weil es keinen etablierten Leitfaden für Referenzarchitekturen oder Anwendungsfälle gibt. Sie behaupten, dass viele Unternehmen so tun, als hätten sie KI-Strategien, während ihnen angemessene Feedback-Schleifen fehlen, um die tatsächliche Wirkung zu messen.
Problematische Metriken und fehlerhafte Ergebnisse
Smiley erklärt, dass die aktuelle Bewertung von KI-Codierung auf falschen Metriken basiert: "Codezeilen, Anzahl der [Pull-Requests] – das sind Belastungen. Das sind keine Maßstäbe für technische Exzellenz." Er nennt als geeignete technische Metriken die Bereitstellungshäufigkeit, die Durchlaufzeit bis zur Produktion, die Fehlerrate bei Änderungen, die mittlere Wiederherstellungszeit und die Schwere von Vorfällen.
Um die Folgen schlechter Messungen zu veranschaulichen, verweist Smiley auf einen kürzlichen Versuch, SQLite mithilfe von KI in Rust neu zu schreiben: "Es bestand alle Unit-Tests, der Code sieht richtig aus. Es sind 3,7-mal mehr Codezeilen, die 2.000-mal schlechter abschneiden als das eigentliche SQLite. Zweitausendmal schlechter für eine Datenbank ist ein nicht lebensfähiges Produkt."
Grundlegende Einschränkungen von LLMs
Deeks weist auf grundlegende Probleme der aktuellen LLM-Technologie hin: "Es ist schwer, ihnen neue Fakten beizubringen. Es ist schwer, Fakten zuverlässig abzurufen. Der Vorwärtsdurchlauf durch die neuronalen Netze ist nicht deterministisch, insbesondere bei Reasoning-Modellen, die einen inneren Monolog nutzen, um die Effizienz der nächsten Token-Vorhersage zu erhöhen – das bedeutet, man erhält jedes Mal eine andere Antwort."
Smiley fügt hinzu: "Und sie haben keine induktiven Denkfähigkeiten. Ein Modell kann seine eigene Arbeit nicht überprüfen. Es weiß nicht, ob die gegebene Antwort richtig ist. Das sind grundlegende Probleme, die bei der LLM-Technologie noch niemand gelöst hat."
Vorgeschlagener neuer Messansatz
Die Gründer plädieren für die Entwicklung neuer Metriken speziell für KI-gestütztes Engineering. Smiley schlägt eine mögliche Metrik vor: "die Messung der verbrauchten Tokens bis zu einem genehmigten Pull-Request – einer formal akzeptierten Softwareänderung." Er betont, dass Organisationen in Feedback-Schleifen experimentieren und iterieren müssen, weil "KI selbst im Codierungskontext noch nicht gut funktioniert".
Deeks verweist auf kürzliche Ausfälle bei Amazon und AWS als Hinweis auf mögliche zukünftige Probleme, obwohl Amazon erklärt hat, dass diese Vorfälle nichts mit KI zu tun hatten.
📖 Read the full source: HN AI Agents
👀 Siehe auch

Ubuntu Linux integriert im nächsten Jahr KI-Funktionen, beginnend mit lokalem Inferencing
Canonical kündigt einen mehrjährigen KI-Vorstoß für Ubuntu an, mit Fokus auf lokale Inferenz, agentische Workflows und kontextbewusste OS-Funktionen, die im Laufe des Jahres 2026 ausgerollt werden.

Claude-Code v2.1.47 Veröffentlichung: Wichtige Fehlerbehebungen und Verbesserungen
Die Veröffentlichung von Claude-Code v2.1.47 bringt wichtige Verbesserungen für die Terminaldarstellung unter Windows, die Dateibehandlung sowie die Ausgabe von Bash-Tools und enthält Verbesserungen der Speicherverwaltung und Leistung.

Google DeepMind-Mitarbeiter stimmen für Gewerkschaftsgründung aufgrund von KI-Militärgeschäften
Mitarbeiter von Google DeepMind in London haben für eine Gewerkschaftsbildung gestimmt und fordern von Google, KI-Verträge mit den US-amerikanischen und israelischen Streitkräften zu kündigen, da Bedenken hinsichtlich der Streichung ethischer Richtlinien bestehen.

Anthropic streicht wichtige Sicherheitsverpflichtung aus Responsible-Scaling-Policy
Anthropic hat die zentrale Verpflichtung aus seiner Responsible Scaling Policy entfernt, die vorschrieb, angemessene Sicherheitsmaßnahmen vor dem Training von KI-Systemen zu garantieren, und verweist dabei auf Wettbewerbsdruck und die Notwendigkeit, die Entwicklung fortzusetzen.