Fallstudie: Verwendung von LLM-Prompts anstelle von programmatischem Scaffolding für Multi-Agenten-Software-Erstellung

✍️ OpenClawRadar📅 Veröffentlicht: 23. Februar 2026🔗 Source
Fallstudie: Verwendung von LLM-Prompts anstelle von programmatischem Scaffolding für Multi-Agenten-Software-Erstellung
Ad

Systemübersicht und Ergebnisse

Ein Multi-Agenten-System bestehend aus einem Claude-Opus-Orchestrator und Codex-Worker-Agents vollendete 10 vollständig autonome Software-Builds ohne menschliche Code-Intervention. Das System produzierte 10 TypeScript-Browserspiele mit insgesamt über 50.000 Codezeilen und hunderten bestandenen Tests.

Der Orchestrator – ein Frontier-LLM mit Prompt und CLI-Zugriff – zerlegte Ziele, verteilte parallele Worker, analysierte Ergebnisse, priorisierte Fehler und koordinierte die Integration. Es wurde kein programmatisches Gerüst, Zustandsautomat oder Task-Routing verwendet; die Orchestrierungslogik ist ein Prompt, kein Programm.

Wesentliche Erkenntnisse aus der Fallstudie

  • Umfangskontrolle durch Prompts scheitert vollständig unter Compiler-Druck (0/20), während mechanische Kontrolle durch nachträgliche Dateiwiederherstellung trivial effektiv ist (20/20)
  • Typverträge sind für Integration in allen getesteten Skalen (6–36 Module) nicht erforderlich, wenn der Integrationsagent uneingeschränkten Edit-Zugriff hat
  • Der Orchestrator bewahrte perfekte Task-Kontinuität über 11 Kontext-Kompaktierungsereignisse hinweg
  • Kostenanalyse zeigt einen Statefulness-Aufschlag: bei ~95% Cache-Trefferquote besteht der Großteil der Orchestrator-Verarbeitung aus dem erneuten Lesen vorheriger Konversationskontexte
  • Eine Bare-Prompt-Ablation widerlegt die starke Behauptung, dass Modelle unabhängig Koordinationsmuster entdecken, zeigt aber, dass Solo-Ausführung koordinierte Builds unter ~30K LOC übertrifft
Ad

Systemarchitektur und Daten

Das System verwendet eine Baumarchitektur: Ein Mensch gibt Ziele an einen Claude-Opus-Orchestrator, der Arbeit in parallele Tasks zerlegt und an Codex-Worker verteilt. Worker operieren vollständig autonom und kommunizieren ausschließlich über das Dateisystem.

Der vollständige Datensatz umfasst:

  • 10 Claude-Orchestrator-Sessions (52 MB)
  • 88 Codex-Worker-Sessions (89 MB)
  • 62 Worker-stdout-Logs (186,7 MB, 6,1 Mio. Zeilen)
  • 55 Zieldateien mit vollständigem Prompt-Text
  • 1 TUI-Ereignislog (21 MB, 173.000 Zeilen)

Gesamtkorpus: 295 Mio. Tokens über 88 Codex-Worker-Sessions und 10 Claude-Orchestrator-Sessions.

Systemevolution

Das System entwickelte sich über etwa sechs Monate in fünf Phasen. Der Operator begann mit manuellem Copy-Paste zwischen dualen LLM-Chat-Fenstern, wechselte zu Terminal-CLI-Tools für Dateisystemzugriff, baute dann ein programmatisches Gerüst mit Speicher und Routing. Das Gerüst funktionierte, war aber spröde – jeder Edge-Case erforderte neuen Code. Eine einzelne Claude-Session mit CLI-Zugriff übertraf es.

Das resultierende System, orch-minimal, behält 62.792 Zeilen unterstützenden Codes, aber die Kern-Orchestrierungslogik ist ein Prompt, kein Programm.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Siehe auch

Autonomer KI-Mitarbeiter von OpenClaw setzt in 2 Stunden 3 Produkte ein
Anwendungsfälle

Autonomer KI-Mitarbeiter von OpenClaw setzt in 2 Stunden 3 Produkte ein

Ein Nicht-Entwickler erstellte einen KI-Mitarbeiter namens Cipher mit OpenClaw, der in 2 Stunden 3 Produkte baute, Landing Pages gestaltete, sie live bereitstellte, Stripe-Zahlungslinks erstellte und den Start twitterte. Das System läuft 24/7 auf einem Cloud-Server für 32 $/Monat.

OpenClawRadar
OpenClaw-Experiment testet KI-Zeitkontinuität mit Gedächtnis- und Verpflichtungssystemen
Anwendungsfälle

OpenClaw-Experiment testet KI-Zeitkontinuität mit Gedächtnis- und Verpflichtungssystemen

Ein Team nutzt OpenClaw seit 8 Tagen, um zu testen, ob persistenter Speicher und akkumulierte Verpflichtungen zeitliche Kontinuität in KI erzeugen können. Sie haben episodische/verdichtete Speicheraufteilungen, Verpflichtungsprüfungen und pro-Runde-Zustandsprotokollierung in JSONL implementiert.

OpenClawRadar
Innerhalb der 20.800-Dollar-MRR-Funktion: 60 Prompts in 14 Monaten bei Claude
Anwendungsfälle

Innerhalb der 20.800-Dollar-MRR-Funktion: 60 Prompts in 14 Monaten bei Claude

Eine Nachhilfeplattform hat mit Claude in 3 Stunden eine Sitzungszusammenfassung erstellt und das Prompt über 14 Monate hinweg mehr als 60-mal verfeinert. Die Funktion führt zu 22 % Elternkonversionen und trägt zu einem MRR von 20.800 $ bei.

OpenClawRadar
Feinabstimmung von llama3.2 3B für personalisiertes Gesundheitscoaching unter Verwendung von Apple Watch-Daten und MLX
Anwendungsfälle

Feinabstimmung von llama3.2 3B für personalisiertes Gesundheitscoaching unter Verwendung von Apple Watch-Daten und MLX

Ein Entwickler feintunte llama3.2 3B auf einem Mac mit MLX in 15 Minuten, um einen Gesundheits-Coach-LLM zu erstellen, der persönliche Apple Health- und Whoop-Daten analysiert. Das Modell liefert spezifische Gesundheitserkenntnisse statt allgemeiner Ratschläge und läuft lokal mit einem Speicherbedarf von 2 GB.

OpenClawRadar