Analyse von 413.000 KI-Agenten-Läufen zeigt, was sie erfolgreich macht

✍️ OpenClawRadar📅 Veröffentlicht: 12. März 2026🔗 Source
Analyse von 413.000 KI-Agenten-Läufen zeigt, was sie erfolgreich macht
Ad

Eine neue Analyse von 413.278 KI-Softwareentwicklungs-Agentenläufen aus dem CoderForge-Preview-Datensatz zeigt, was erfolgreiche von fehlgeschlagenen Läufen unterscheidet. Die Studie untersuchte 17 Milliarden Token an Verhaltensdaten und verglich bestandene mit nicht bestandenen Läufen bei identischen Problemen.

Wichtige Erkenntnisse aus den Daten

Die Analyse zeigt, dass gängige menschliche Softwareentwicklungspraktiken die Leistung von KI-Agenten tatsächlich verringern können. Hier sind die spezifischen Muster, die sich zeigten:

  • Hören Sie auf, Agenten zu sagen, sie sollen „zuerst umsehen“: Das Zwingen von Agenten, Dateien zu durchsuchen oder anzuschauen, bevor sie bearbeiten, verringert die Effektivität. Im Gegensatz zu Menschen mit begrenztem Arbeitsgedächtnis haben Agenten den Code bereits in ihrem Kontextfenster. Frühe Schritte, die mit Suchen und Erkunden verbracht werden, deuten darauf hin, dass der Agent herumirrt, anstatt zu lernen.
  • Testgetriebene Ansätze sind zwingend erforderlich: Der größte Prädiktor für erfolgreiche Läufe ist der Anteil früher Bash-Befehle, die ausschließlich dem Ausführen von Tests gewidmet sind. Agenten sollten nicht blind bearbeiten – Systemaufforderungen sollten das sofortige Ausführen der Testsuite erzwingen.
  • Halten Sie Agenten an der kurzen Leine: Wenn ein Agent versucht, in den ersten 30 % seines Laufs 3 oder mehr Dateien zu bearbeiten, sinken die Erfolgsquoten deutlich. Das Verteilen von Änderungen auf mehrere Dateien deutet auf Verwirrung hin. Zwingen Sie Agenten, eine Sache nach der anderen zu beheben.
  • Ausdauer ist eine Illusion: Wenn ein Agent denselben Bash-Befehl zweimal früh im Lauf ausführt, steckt er in einer Schleife fest, anstatt „intensiv nachzudenken“ oder „es erneut zu versuchen“. Brechen Sie die Schleife oder starten Sie den Lauf neu.
Ad

Praktische Implementierungsänderungen

Die Analyse empfiehlt spezifische Änderungen am Agenten-Scaffolding:

  • Verwenden Sie keine Aufforderungen wie: „Erkunden Sie die Codebasis, lesen Sie die relevanten Dateien und finden Sie den Fehler heraus.“
  • Verwenden Sie stattdessen: „Führen Sie die Testsuite sofort aus, um die Basislinie zu überprüfen. Nehmen Sie gezielte Änderungen an maximal 1 oder 2 Dateien vor. Führen Sie die Tests erneut aus.“

Die zentrale Einsicht ist, aufzuhören, menschliche Einschränkungen auf LLMs zu projizieren. Lassen Sie sie ihre riesigen Kontextfenster nutzen und zwingen Sie sie, ihre Arbeit mit Tests zu beweisen.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Siehe auch

Laut Bericht soll Palantir-KI in das gesamte US-Militär integriert werden
Nachrichten

Laut Bericht soll Palantir-KI in das gesamte US-Militär integriert werden

Ein Bericht deutet darauf hin, dass das US-Militär plant, Palantirs KI-Technologie in allen Teilstreitkräften zu integrieren. Der Artikel erzielte 37 Punkte und 24 Kommentare auf Hacker News.

OpenClawRadar
xAI verliert rechtliche Anfechtung gegen kalifornisches KI-Datenoffenlegungsgesetz
Nachrichten

xAI verliert rechtliche Anfechtung gegen kalifornisches KI-Datenoffenlegungsgesetz

xAI hat seinen Versuch, das kalifornische KI-Daten-Offenlegungsgesetz zu blockieren, verloren. Dieses Gesetz verlangt von Unternehmen, die Quellen ihrer Trainingsdaten und andere Details über ihre KI-Systeme offenzulegen. Das Gerichtsurteil bedeutet, dass das Gesetz wie geplant in Kraft treten wird.

OpenClawRadar
Claude Code v2.1.149: Nutzungsaufschlüsselung, Berechtigungsbehebungen und Tastaturnavigation
Nachrichten

Claude Code v2.1.149: Nutzungsaufschlüsselung, Berechtigungsbehebungen und Tastaturnavigation

Claude Code v2.1.149 fügt eine nach Kategorien aufgeschlüsselte Nutzungsübersicht, eine per Tastatur scrollbare Diff-Ansicht, GFM-Aufgabenlisten-Kontrollkästchen hinzu und behebt mehrere Berechtigungsumgehungen sowie Sandbox-Probleme.

OpenClawRadar
Benutzer berichten, dass Sonnet 4.6 Opus 4.6 bei praktischen Programmieraufgaben übertrifft
Nachrichten

Benutzer berichten, dass Sonnet 4.6 Opus 4.6 bei praktischen Programmieraufgaben übertrifft

Ein Entwickler, der Claude-AI-Modelle testete, stellte fest, dass Opus 4.6 überkomplizierte Lösungen mit Leistungslücken lieferte, während Sonnet 4.6 sorgfältigere, effizientere Korrekturen mit geringerem Token-Verbrauch erbrachte.

OpenClawRadar