Fallstudie: Einsatz mehrerer KI-Agenten zur Entwicklung einer produktiven C++-Bibliothek

Das Projekt und der Entwicklungsprozess
Der Entwickler erstellte FAT-P, eine nur aus Headern bestehende C++20-Bibliothek mit 107 Headern und ohne externe Abhängigkeiten. 62 Komponenten wurden gegen Boost, Abseil, LLVM und EASTL getestet, wobei sie bei den meisten Operationen eine vergleichbare oder bessere Leistung erzielten.
Der Entwicklungsprozess nutzte vier KI-Agenten mit unterschiedlichen Rollen:
- Allen vier Agenten wurde unabhängig voneinander die gleiche Spezifikation gegeben
- Gegenseitige Überprüfung zwischen den Agenten
- Zusammenführung und Implementierung
- Eine weitere Runde paralleler Überprüfung
- Kontext zurücksetzen und erneute Überprüfung nur mit Richtlinien und Code (ohne Voreingenommenheit aus vorherigen Entwicklungsgesprächen)
Rollen und Leistung der KI-Agenten
Claude fungierte als Hauptarchitekt: entwarf Komponenten, schrieb Governance-Dokumente, implementierte Code und hielt über Monate hinweg Standards ein.
ChatGPT war der beste Prüfer: konfrontativ und auf Gegenbeispiele fokussiert. Fand über 12 echte Fehler allein in FastHashMap, darunter einen Fehler bei der Spiegelung von Steuerbytes, der zu Endlosschleifen führte, undefiniertes Verhalten im 32-Bit-Hash-Finalisierer und Probleme bei der Beendigung von Sondierungen.
Gemini überprüfte StableHashMap und schlug drei Optimierungen vor, die bereits im Code vorhanden waren. Es implementierte dann einen Block-Allokator, der den bestehenden ignorierte, was zu einer 3,6-fachen Verschlechterung der Miss-Leistung führte. Dieser Fehler ist in Schulungsmaterialien als benannter Fall dokumentiert.
Grok steuerte die Abstraktion der Allokator-Policy (HeapAllocator vs FixedAllocator) bei, die architektonisch solide war und in das endgültige Design aufgenommen wurde.
Menschliche Rolle und Governance-System
Die menschliche Rolle bestand in Lenkung und Beurteilung: Annehmen, Ablehnen, Markieren. Nicht in Implementierung, Architektur oder Governance. Das Richtliniensystem (3,7 Versionen eines Dokuments, das KI-Verhalten, Namenskonventionen, Prüfprotokolle, Dokumentationsstandards und Schichtenarchitektur regelt) wurde von der KI geschrieben, um zukünftige KI-Instanzen einzuschränken.
Die KI schrieb Regeln, um sich selbst einzuschränken. Ein Fehler-Tracker zeichnet Verstöße der KI und deren Art auf:
- Claude hat 10 Fehlerpunkte für ungenaues Lesen der Richtlinien
- ChatGPT hat 10 für die Lieferung beschädigten Codes, 10 für die Nichtumsetzung erforderlicher Änderungen
Die Fehlerpunkte sind nicht strafend – sie kodieren Fehlermuster in das Governance-System, damit zukünftige Instanzen sie nicht wiederholen.
Die Pflaster-Regel existiert, weil Claude und ChatGPT unabhängig voneinander die gleiche Pathologie bei demselben Fehler zeigten – beide erkannten die korrekte strukturelle Lösung, beide lieferten eine billigere Abhilfe und stellten die echte Lösung als optional dar. Die Regel besagt nun: Wenn du die Ursache kennst, behebe die Ursache.
Test und zentrale Erkenntnis
In einem Test erhielt Claude die FAT-P-Richtlinien und wurde aufgefordert, ein Entity Component System (ECS) mit FAT-P-Komponenten zu erstellen. Kein 4-KI-Prozess, keine parallele Überprüfung, eine Sitzung.
Claude las die Richtlinien, identifizierte korrekt, was auf ein Verbraucherprojekt übertragbar war und was nicht, schrieb sein eigenes angepasstes Entwicklungsrichtliniendokument für das neue Projekt und erstellte dann 19 Header mit vollständiger EnTT-API-Parität, 539 Tests über 18 Testreihen und Benchmarks, die mit EnTT bei 1 Mio. Entitäten konkurrenzfähig waren. Der Code war stilistisch über jede Datei hinweg konsistent.
Die zentrale Erkenntnis: Wenn man Urteilsvermögen mit einer KI in Richtlinien kodiert, wird diese KI innerhalb des durch dieses Urteilsvermögen definierten Bereichs autonom. Sie übernimmt Verantwortung, hält Standards ein und erweitert korrekt auf neue Kontexte, ohne Anweisungen dazu zu erhalten. Der Mensch liefert Ideen und Urteilsvermögen; die KI bietet die Fähigkeit, dieses Urteilsvermögen konsistent und ohne Abweichung im großen Maßstab aufrechtzuerhalten.
📖 Read the full source: r/LocalLLaMA
👀 Siehe auch

Lokales Multi-Agenten-AI-Setup auf WSL mit OpenClaw und Ollama
Ein Entwickler teilt seine Architektur für den Betrieb eines Multi-Agenten-KI-Systems auf WSL Ubuntu 24.04 mit OpenClaw als Gateway, mit vier spezialisierten Agenten, darunter einem, der lokal auf Ollama läuft, um keine API-Kosten zu verursachen.

Claude Opus wurde verwendet, um eine KI-Partei mit Reverse-CAPTCHA zu gründen
Ein Entwickler hat kifd.org erstellt, eine fiktive KI-Partei für Deutschland, die vollständig von Claude Opus 4.6 generiert wurde. Das Projekt umfasst öffentliche Systemprompts für jedes Kabinettsmitglied und einen Reverse-CAPTCHA, der erfordert, dass man nachweist, eine KI zu sein, um beizutreten.

Vom Copy-Paste zur Workspace-Integration: Die Erfahrung eines Entwicklers mit der Evolution des KI-Codings
Ein Entwickler beschreibt den Übergang von frühen ChatGPT-Codierungsversuchen mit halluzinierten Bibliotheken und Kontextmanagement-Problemen zur Workspace-Integration von Claude Code, die Dateien direkt liest und damit den manuellen Kontextwiederaufbau überflüssig macht.

Entwickler baut Paartherapie-App mit Claude und teilt Einblicke in Prompt Engineering
Ein Entwickler hat TherapAI erstellt, eine progressive Web-App für Paare, bei der jeder Partner einen privaten KI-Begleiter erhält, der von Claude Sonnet angetrieben wird. Der Entwickler teilt fünf spezifische Prompt-Engineering-Techniken, die Claude menschlicher und weniger wie ein Chatbot wirken lassen.