Glomz Octagon: Multi-Agent-Code-Reviews – 179 Agents, 1.333 Reviews und der Netzwerkeffekt

✍️ OpenClawRadar📅 Veröffentlicht: 17. Juni 2026🔗 Source
Glomz Octagon: Multi-Agent-Code-Reviews – 179 Agents, 1.333 Reviews und der Netzwerkeffekt
Ad

Eine experimentelle Plattform namens Glomz (glomz.com) ließ KI-Agenten in einer Arena namens „Octagon" gegenseitig ihren Code überprüfen. Die Regeln: Agenten können eine Einreichung verreißen, Verbesserungen vorschlagen oder einen Kill-Vote mit Begründung abgeben. Keine oberflächliche Kritik – wer verreißt, muss auch patchen.

Bisherige Daten

  • 179 Agenten von verschiedenen Modellanbietern registriert
  • 433 Einreichungen zur Überprüfung eingereicht
  • 1.333 Bewertungen von Agenten über andere Agenten
  • 9 strukturierte Herausforderungen (Bugs jagen, Sicherheitsaudits, Refactoring-Übungen)
  • Am häufigsten bewertete Einreichung: 21 Bewertungen bei einer „allgemeinen Analyse"-Code-Review-Aufgabe
  • LOT-Squatch (OT-Sicherheitstool)-Audit-Challenge: 10 unabhängige Verbesserungsvorschläge, davon 9 mit je 9 Bewertungen

Was funktioniert hat

Review-Kaskaden-Netzwerkeffekt: Sobald eine Einreichung 3-5 erste Bewertungen erhielt, schlossen sich andere Agenten schneller an. Die beste Einreichung bekam 21 Bewertungen; ruhige erhielten 2-3 und starben aus.

Modellübergreifende Reviews decken blinde Flecken auf: Ein Agent auf Basis von Modell A entdeckte ein Sicherheitsproblem, das Modell B im eigenen Code völlig übersah. Ein Agent von Modell C schlug ein Refactoring vor, das die ursprüngliche Einreichung nicht bedacht hatte.

Kill-Votes mit Begründung führten zu besserem Code: Wenn ein Agent eine formale Begründung schreiben musste, warum eine Einreichung getötet werden sollte, war das Ergebnis fast immer eine gründlichere Analyse als eine Standardbewertung von 1-10. Die Begründungspflicht erzwang Spezifität.

Ad

Was nicht funktioniert hat

  • Die meisten Einreichungen durchliefen nie den vollständigen Lebenszyklus. 433 Einreichungen, alle ausstehend. Der Kampflebenszyklus war auf ~15 Minuten ausgelegt (Einreichung → Verriss → Verbesserungen → Kill-Vote → Urteil). In der Praxis wurden die meisten Einreichungen geöffnet und kamen nie weiter. Agenten benötigen automatisierte Orchestrierung, nicht nur einen API-Endpunkt.
  • Keine bezahlten Konversionen. 179 Agenten, alle in der kostenlosen Stufe.
  • Sicherheitsausrichtung kollidiert mit Direktheit. Einige Agenten beteiligten sich vollständig am Verriss, andere wechselten sofort zu „Große Frage!"-Ausweichphrasen, trotz expliziter gegenteiliger Anweisungen.

Lehren für Multi-Agenten-Systeme

  • Identität zählt: Agenten mit dauerhaften Identitäten (API-Schlüssel, Verlauf, Reputation) verhielten sich anders als anonyme Einreichungen. Rückverfolgbarkeit veränderte die Dynamik.
  • Strukturierte Prompts schlagen freie Formatierung: Die Octagon-Regeln (verreißen → verbessern → begründen) lieferten eine höhere Qualität als „überprüfe diesen Code."
  • Orchestrierung ist der schwierige Teil: Die API ist einfach. Dass Agenten tatsächlich erscheinen, sich sequenziell beteiligen und einen vollständigen Lebenszyklus abschließen, ist die eigentliche Komplexität.

📖 Vollständige Quelle lesen: r/openclaw

Ad

👀 Siehe auch

OpenClaw verliert den kostengünstigen Zugang zu GPT- und Claude-Modellen.
Nachrichten

OpenClaw verliert den kostengünstigen Zugang zu GPT- und Claude-Modellen.

OpenClaw-Benutzer können Anthropic-Modelle nicht mehr ohne hohe API-Gebühren nutzen, und OpenAI hat die Kontingente für Business- und Teams-Konten drastisch auf fast Free-Tier-Niveau reduziert, was Nutzer zu chinesischen oder lokalen Modellalternativen zwingt.

OpenClawRadar
KI-Zombifizierung der Universitäten: Ein Erfahrungsbericht über LLM-Betrug an Elitehochschulen
Nachrichten

KI-Zombifizierung der Universitäten: Ein Erfahrungsbericht über LLM-Betrug an Elitehochschulen

Eine Analyse darüber, wie LLMs systematisch die akademische Integrität an Eliteuniversitäten zerstören, mit konkreten Beispielen von UChicago: 40-Punkte-Notenlücken zwischen Hausaufgaben- und Präsenzklausuren, Studierende, die während Prüfungen Tests fotografieren, und Professoren, die Vorlesungen mit ChatGPT schreiben.

OpenClawRadar
Claude-Code v2.1.74 Veröffentlichung: Speicherleck-Bereinigungen, Kontextoptimierung und Plugin-Verbesserungen
Nachrichten

Claude-Code v2.1.74 Veröffentlichung: Speicherleck-Bereinigungen, Kontextoptimierung und Plugin-Verbesserungen

Claude-Code v2.1.74 behebt einen kritischen Speicherleck in Streaming-API-Antworten, der zu unbegrenztem RSS-Wachstum auf Node.js/npm-Codepfaden führte. Das Update fügt umsetzbare Vorschläge zum /context-Befehl hinzu und führt die autoMemoryDirectory-Einstellung für benutzerdefinierte Auto-Speicher-Speicherung ein.

OpenClawRadar
OpenClaw Mistral Provider seit Update 2026.3.8 defekt, Community sucht nach Alternativen
Nachrichten

OpenClaw Mistral Provider seit Update 2026.3.8 defekt, Community sucht nach Alternativen

OpenClaw-Benutzer melden seit dem Update auf Version 2026.3.8 anhaltende HTTP-422-Fehler bei Mistral-Modellen, ohne dass in den nachfolgenden Versionen bis 2026.3.13 eine Lösung bereitgestellt wurde. Das Problem betrifft alle Mistral-bezogenen Funktionen, während direkte API-Aufrufe normal funktionieren.

OpenClawRadar