Kaltvalidierungsarchitektur: Dual-Agent-Code-Review-System als Open Source veröffentlicht

Cold Validation Architecture ist ein Open-Source-System, das eine Dual-Agent-Validierung für KI-generierten Code implementiert. Ein Agent schreibt den Code, während ein separater Agent ihn unabhängig prüft, ohne Zugriff auf die Überlegungen oder den Kontext des Erstellers zu haben.
Wie es funktioniert
Das System adressiert die Selbstprüfungsverzerrung bei Einzelagenten durch die Anwendung einer Aufgabentrennung ähnlich unabhängiger Audits. Der Prüfer arbeitet in vollständiger Isolation vom Denkprozess des Erstellers.
Arbeitsablaufphasen
- Plan schreiben →
/review-plan(Gate A) - Implementieren →
/review-impl(Gate C) - Ausliefern →
/acceptance-report(Gate D)
Wichtige Implementierungsdetails
- Der Prüfer läuft in einem isolierten temporären Verzeichnis
- Prüfer sieht nur: Plan-Dokument, Code-Diff und Testergebnis
- Ergebnisse bleiben mit Fingerabdrücken zur Nachverfolgung erhalten
- Ersteller kann der Begründung des Prüfers widersprechen
- Maximal 2 Runden pro Phase
- Erstellt mit Bash-Skripten und JSON-Schemata
- Funktioniert derzeit mit Claude Code + Codex CLI
- Muster ist agentenunabhängig (funktioniert mit verschiedenen KI-Agenten)
Technische Spezifikationen
Das System ist als Bash-Skripte implementiert, die zwischen zwei separaten KI-Agenten koordinieren. JSON-Schemata definieren die Struktur für Plan-Dokumente, Code-Überprüfungen und Abnahmeprotokolle. Die isolierte Ausführungsumgebung stellt sicher, dass der Prüfer keinen Zugriff auf die internen Überlegungen oder Zwischenschritte des Erstellers hat.
Dieser Ansatz ist nützlich für Entwickler, die eine strengere Validierung für KI-generierten Code implementieren möchten, insbesondere bei der Arbeit mit komplexen Systemen, bei denen die Selbstprüfung durch einen einzelnen Agenten Bestätigungsverzerrungen einführen könnte.
📖 Read the full source: r/LocalLLaMA
👀 Siehe auch

OpenClaw vs Hermes: Unterschiedliche Designphilosophien für KI-Agenten
OpenClaw ist ein Multi-Channel-Gateway, das WhatsApp, Telegram, Discord, Slack und iMessage mit einem umfangreichen Skill-Ökosystem verbindet, während Hermes ein lernender Agent ist, der Aufgaben bewertet, Muster als wiederverwendbare Skills speichert und im Laufe der Zeit ein Modell Ihres Workflows aufbaut.

Wrangle: Ein nativer macOS-Editor zur Verwaltung von Claude-Code-Sitzungen
Wrangle ist ein nativer macOS-Markdown-Editor, der speziell für die Verwaltung mehrerer Claude Code-Sitzungen entwickelt wurde und eingebettete Terminals sowie intelligente Benachrichtigungen bietet. Der Entwickler hat ihn erstellt, nachdem VS Code mit seinem täglichen Workflow, bei dem viele Claude Code-Sitzungen laufen, nicht mehr mithalten konnte.

Knowledge Raven: Ein durchsuchbares Wissensdatenbank-Plugin für Claude
Knowledge Raven ist ein Tool, das es Claude ermöglicht, Ihre Dokumente aus Quellen wie Confluence, Notion, Google Drive, Dropbox und GitHub über ein Claude Desktop-Plugin oder einen MCP-Server zu durchsuchen. Es bietet semantische Suche, Stichwortsuche und vollständige Dokumentenabrufe.

Claude Code wurde verwendet, um über 4.000 Blind-Werewolf-Spiele mit LLMs zu simulieren
Ein Entwickler nutzte Claude Code, um einen Simulator zu erstellen, in dem LLMs blindes Ein-Nacht-Werwolf spielen, mit etwa 4.600 Spielen über OpenAI- und xAI-Modelle hinweg. Das Experiment zeigte konsistente namensbasierte Abstimmungsmuster trotz minimaler Spielsignale.