Seien Sie mein Butler: Multi-Agenten-Pipeline zur Überprüfung von KI-Code

Was Be My Butler tut
Be My Butler (BMB) ist eine Multi-Agent-Pipeline, die ein spezifisches Problem beim KI-gestützten Programmieren löst: wenn KI-Coding-Agenten ihren eigenen Code fälschlicherweise als funktionierend melden. Der Entwickler, ein Werkstoff-/Maschinenbauingenieur ohne Programmierhintergrund, baute dies, nachdem er erlebt hatte, dass Claude-Code-Agenten Code schrieben, der Tests bestand, aber in der Praxis nicht wirklich funktionierte.
Kernkonzept
Das System implementiert ein Peer-Review-Modell für KI-generierten Code:
- Ein Modell schreibt den Code
- Ein anderes Modell überprüft ihn, ohne zu wissen, wer ihn geschrieben hat (blinde Verifizierung)
- Ein Cross-Model-Rat (Claude + GPT + Gemini) stimmt darüber ab, ob er tatsächlich funktioniert
- Ein Analysten-Agent verfolgt Muster bei Fehlern
Leistungsmetriken
Aus Tests:
- Einzelagenten-Selbstüberprüfung erkennt ~40 % der echten Probleme
- Cross-Model-Blinüberprüfung erkennt ~85 %
- Kostenmehraufwand: 15–20 % mehr Tokens
v0.2-Funktionen
- Analytics-Dashboard zur Verfolgung von Token-Nutzung und Kosten
- Analysten-Agent für automatisierte Code-Review-Muster
- Berater-Agent für Architekturentscheidungen
- Verbesserte tmux-basierte Orchestrierung
Installation und Nutzung
Vollständig Open Source unter MIT-Lizenz. Installation:
git clone https://github.com/project820/be-my-butler.git
cd be-my-butler && ./install.sh
bmb "build a REST API with auth"Das Tool ist besonders nützlich für "Vibe-Coder" – Menschen ohne traditionelle Programmiererfahrung, die auf KI für die Code-Qualitätsbewertung angewiesen sind. Wenn man Code nicht selbst lesen kann, um Probleme zu erkennen, bietet die gegenseitige Überprüfung durch mehrere Modelle eine Verifizierung, die Einzelagenten-Systemen fehlt.
📖 Read the full source: r/ClaudeAI
👀 Siehe auch

OpenClaw-Benutzer berichten von Planungs- und Überprüfungsengpässen bei KI-Agenten.
OpenClaw-Benutzer beschreiben Planungs- und Überprüfungsabläufe als 'MS-DOS-artig', trotz effektiver Codegenerierung, und verweisen auf manuelle Eingriffe, Dokumentenfragmentierung und Verlust von Argumentation während der Agentenkooperation. Einige experimentieren mit agentennativen Dokumenteneditoren wie comment.io und Proof by Every.

Agentlint: GitHub-App, die Widersprüche in CLAUDE.md und defekte Verweise bei jedem PR erkennt.
Agentlint ist eine GitHub-App, die bei jedem PR Ihre gesamte Agent-Regeloberfläche (CLAUDE.md, AGENTS.md, Skills, Hooks) prüft und Inline-Kommentare zu Widersprüchen, ungültigen Pfaden und nicht unterstützten Harness-Funktionen postet. Kostenlos für öffentliche Repos.

Gemini 3.1 Pro in Multi-Agenten-Systemen: Hohe Designqualität, 20% Fehlerrate bei Tool-Aufrufen
Entwickler, die Bobr, einen KI-Präsentationsgenerator mit einer Multi-Agenten-Architektur erstellen, berichten, dass Gemini 3.1 Pro beeindruckende Design-Ergebnisse liefert, aber unter einer Ausfallrate von Werkzeugaufrufen von ~20 % und verstümmelter Textkorruption in Produktions-Pipelines leidet.

Bibliothek mit 59 Open-Source-Claude-Fähigkeiten deckt den gesamten Website-Lebenszyklus ab
Ein Entwickler hat 59 wiederverwendbare Claude-Fähigkeiten veröffentlicht, die Markenfindung, Design, Content, SEO, Entwicklung, Betrieb und Wachstum abdecken – stack-agnostisch, mit einheitlicher Struktur und CI-Lint-Validierung.