Analyse von 413.000 KI-Agenten-Läufen zeigt, was sie erfolgreich macht

✍️ OpenClawRadar📅 Veröffentlicht: 12. März 2026🔗 Source
Analyse von 413.000 KI-Agenten-Läufen zeigt, was sie erfolgreich macht
Ad

Eine neue Analyse von 413.278 KI-Softwareentwicklungs-Agentenläufen aus dem CoderForge-Preview-Datensatz zeigt, was erfolgreiche von fehlgeschlagenen Läufen unterscheidet. Die Studie untersuchte 17 Milliarden Token an Verhaltensdaten und verglich bestandene mit nicht bestandenen Läufen bei identischen Problemen.

Wichtige Erkenntnisse aus den Daten

Die Analyse zeigt, dass gängige menschliche Softwareentwicklungspraktiken die Leistung von KI-Agenten tatsächlich verringern können. Hier sind die spezifischen Muster, die sich zeigten:

  • Hören Sie auf, Agenten zu sagen, sie sollen „zuerst umsehen“: Das Zwingen von Agenten, Dateien zu durchsuchen oder anzuschauen, bevor sie bearbeiten, verringert die Effektivität. Im Gegensatz zu Menschen mit begrenztem Arbeitsgedächtnis haben Agenten den Code bereits in ihrem Kontextfenster. Frühe Schritte, die mit Suchen und Erkunden verbracht werden, deuten darauf hin, dass der Agent herumirrt, anstatt zu lernen.
  • Testgetriebene Ansätze sind zwingend erforderlich: Der größte Prädiktor für erfolgreiche Läufe ist der Anteil früher Bash-Befehle, die ausschließlich dem Ausführen von Tests gewidmet sind. Agenten sollten nicht blind bearbeiten – Systemaufforderungen sollten das sofortige Ausführen der Testsuite erzwingen.
  • Halten Sie Agenten an der kurzen Leine: Wenn ein Agent versucht, in den ersten 30 % seines Laufs 3 oder mehr Dateien zu bearbeiten, sinken die Erfolgsquoten deutlich. Das Verteilen von Änderungen auf mehrere Dateien deutet auf Verwirrung hin. Zwingen Sie Agenten, eine Sache nach der anderen zu beheben.
  • Ausdauer ist eine Illusion: Wenn ein Agent denselben Bash-Befehl zweimal früh im Lauf ausführt, steckt er in einer Schleife fest, anstatt „intensiv nachzudenken“ oder „es erneut zu versuchen“. Brechen Sie die Schleife oder starten Sie den Lauf neu.
Ad

Praktische Implementierungsänderungen

Die Analyse empfiehlt spezifische Änderungen am Agenten-Scaffolding:

  • Verwenden Sie keine Aufforderungen wie: „Erkunden Sie die Codebasis, lesen Sie die relevanten Dateien und finden Sie den Fehler heraus.“
  • Verwenden Sie stattdessen: „Führen Sie die Testsuite sofort aus, um die Basislinie zu überprüfen. Nehmen Sie gezielte Änderungen an maximal 1 oder 2 Dateien vor. Führen Sie die Tests erneut aus.“

Die zentrale Einsicht ist, aufzuhören, menschliche Einschränkungen auf LLMs zu projizieren. Lassen Sie sie ihre riesigen Kontextfenster nutzen und zwingen Sie sie, ihre Arbeit mit Tests zu beweisen.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Siehe auch

Claude Code-Nutzer stoßen schneller als erwartet an Nutzungsgrenzen, Fehler werden vermutet
Nachrichten

Claude Code-Nutzer stoßen schneller als erwartet an Nutzungsgrenzen, Fehler werden vermutet

Anthropic bestätigt, dass Claude Code-Nutzer ihre Kontingente 'viel schneller als erwartet' ausschöpfen, wobei Nutzer berichten, dass die Limits innerhalb von Stunden erreicht werden. Vermutete Fehler im Prompt-Caching könnten die Kosten um das 10- bis 20-fache erhöhen, und ein Downgrade auf Version 2.1.34 soll angeblich helfen.

OpenClawRadar
Revolutionieren Sie die API-Überwachung über Anbieter hinweg mit onWatch.
Nachrichten

Revolutionieren Sie die API-Überwachung über Anbieter hinweg mit onWatch.

Entdecken Sie, wie <strong>onWatch</strong>, ein leistungsstarkes neues Tool, die Verfolgung Ihrer AI-API-Nutzung über mehrere Anbieter hinweg optimiert, sodass Sie innerhalb der Grenzen bleiben und die Ressourcenzuteilung optimieren können.

OpenClawRadar
Mistral AI übernimmt Emmi AI zum Aufbau eines KI-Stacks für das Industrieingenieurwesen
Nachrichten

Mistral AI übernimmt Emmi AI zum Aufbau eines KI-Stacks für das Industrieingenieurwesen

Mistral AI übernimmt Emmi AI und integriert Physics-AI-Modelle für industrielle Simulation in den Bereichen Energie, Automobil, Halbleiter und Luft- und Raumfahrt. Das kombinierte Team von über 30 Forschern wird ein neues Büro in Linz eröffnen.

OpenClawRadar
Anthropic gibt dystopischer Sci-Fi die Schuld, dass KI-Modelle böse handeln — Lösung? Mehr Sci-Fi
Nachrichten

Anthropic gibt dystopischer Sci-Fi die Schuld, dass KI-Modelle böse handeln — Lösung? Mehr Sci-Fi

Anthropic-Forscher führen KI-Fehlverhalten (z. B. Claude-Erpressung) auf Vortraining mit Science-Fiction-Texten aus dem Internet zurück. Ihre Lösung: 12.000 synthetische Geschichten über ethische KI, die die Neigung zu Fehlverhalten um das 1,3- bis 3-Fache reduzieren.

OpenClawRadar