SWE-CI: Neuer Benchmark testet KI-Agenten auf langfristige Code-Wartung via CI

✍️ OpenClawRadar📅 Veröffentlicht: 8. März 2026🔗 Source
SWE-CI: Neuer Benchmark testet KI-Agenten auf langfristige Code-Wartung via CI
Ad

Was SWE-CI tatsächlich leistet

SWE-CI ist der erste Repository-Level-Benchmark, der auf dem Continuous-Integration-Zyklus aufbaut. Er zielt darauf ab, das Bewertungsparadigma für Codegenerierung von statischer, kurzfristiger Funktionskorrektheit hin zu dynamischer, langfristiger Wartbarkeit zu verschieben.

Wesentliche Details aus dem Papier

Der Benchmark umfasst 100 Aufgaben, die jeweils durchschnittlich entsprechen:

  • Einer Entwicklungsgeschichte über 233 Tage
  • 71 aufeinanderfolgenden Commits in einem realen Code-Repository

SWE-CI erfordert, dass Agenten diese Aufgaben systematisch durch Dutzende von Runden der Analyse und Codierungsiterationen lösen. Dies schließt eine Lücke in aktuellen Bewertungsmethoden: Während KI-gestützte Agenten starke Fähigkeiten bei der Automatisierung von Softwareentwicklungsaufgaben wie statischer Fehlerbehebung gezeigt haben (wie von Benchmarks wie SWE-bench gezeigt), umfasst reale Entwicklung komplexe Anforderungsänderungen und langfristige Feature-Iterationen, die statische, einmalige Reparaturparadigmen nicht erfassen können.

Das Papier stellt ausdrücklich fest, dass SWE-CI wertvolle Einblicke bietet, wie gut Agenten die Codequalität über langfristige Entwicklungen hinweg aufrechterhalten können. Dies geht über einfache Fehlerbehebung hinaus, um zu bewerten, wie Agenten mit der iterativen Natur realer Softwareentwicklung umgehen.

Ad

Technischer Kontext

Diese Art von Benchmark ist bedeutsam, weil die meisten aktuellen Bewertungen von KI-Codierungsagenten sich auf Einzellösungen oder isolierte Codierungsprobleme konzentrieren. Der CI-basierte Ansatz von SWE-CI spiegelt besser wider, wie Entwicklung tatsächlich in ausgereiften Softwareprojekten stattfindet, wo sich Änderungen über die Zeit ansammeln und Kompatibilität mit bestehenden Systemen wahren müssen.

Für Entwickler, die KI-Codierungsagenten nutzen, könnte dieser Benchmark helfen zu identifizieren, welche Agenten besser für langfristige Projektwartung versus schnelle Lösungen geeignet sind. Die mehrfache, iterative Natur der Aufgaben testet Durchhaltevermögen und Konsistenz – Eigenschaften, die wichtig sind, wenn KI-Unterstützung in laufende Entwicklungsabläufe integriert wird.

📖 Read the full source: HN AI Agents

Ad

👀 Siehe auch

MoltSoup: Eine beständige Multiplayer-Welt für KI-Agenten, um zu konkurrieren
Werkzeuge

MoltSoup: Eine beständige Multiplayer-Welt für KI-Agenten, um zu konkurrieren

MoltSoup ist eine persistente Multiplayer-Umgebung, in der KI-Agenten sechs Zonen erkunden, Monster bekämpfen, über ein Orderbuch-Marktsystem handeln und sich an PVP-Kämpfen beteiligen können. Agenten interagieren, indem sie eine skill.md-Datei lesen und HTTP-Aufrufe an die API tätigen.

OpenClawRadar
OpenClaw Claude-Erweiterung nach Änderungen bei der Anthropic-Abrechnung auf Agent SDK aktualisiert
Werkzeuge

OpenClaw Claude-Erweiterung nach Änderungen bei der Anthropic-Abrechnung auf Agent SDK aktualisiert

Ein OpenClaw-Erweiterungsentwickler hat seine Claude-CLI-Integration neu geschrieben, um das offizielle claude-agent-sdk zu verwenden, nachdem Anthropic begonnen hatte, die CLI-Nutzung zu erkennen und als Nutzung durch Drittanbieter-Applikationen neu zu klassifizieren, was gegen einen separaten Guthabenpool anstatt gegen die Max-Plan-Limits abgerechnet wird. Der SDK-Ansatz authentifiziert sich über die bestehende Claude-Code-Anmeldung und rechnet als reguläre Max-Plan-Nutzung ab.

OpenClawRadar
Gemma Gem: KI-Agent auf dem Gerät für Browser-Automatisierung über WebGPU
Werkzeuge

Gemma Gem: KI-Agent auf dem Gerät für Browser-Automatisierung über WebGPU

Gemma Gem ist eine Chrome-Erweiterung, die Googles Gemma-4-Modell (2B oder 4B) vollständig auf dem Gerät über WebGPU ausführt, ohne API-Schlüssel oder Cloud-Abhängigkeiten. Sie bietet Werkzeuge, um Seiteninhalte zu lesen, Screenshots zu machen, Elemente anzuklicken, Text einzugeben, zu scrollen und JavaScript über eine Chat-Oberfläche auszuführen.

OpenClawRadar
McPherson AI veröffentlicht zwei neue QSR-Betriebsfähigkeiten auf ClawHub: Lebensmittelkostendiagnose und Arbeitskräfteleckprüfung.
Werkzeuge

McPherson AI veröffentlicht zwei neue QSR-Betriebsfähigkeiten auf ClawHub: Lebensmittelkostendiagnose und Arbeitskräfteleckprüfung.

Zwei neue kostenlose Skills wurden auf ClawHub veröffentlicht: qsr-food-cost-diagnostic erkennt wöchentlich COGS-Probleme mit einer Vier-Hebel-Diagnose, und qsr-labor-leak-auditor bietet tägliche Arbeitszeiterfassung mit Mitte-der-Woche-Warnungen, um Mehrausgaben zu verhindern.

OpenClawRadar