Anthropics Multi-Agent-Harness-Design zur Verbesserung der Codequalität von Claude

Anthropic hat einen Blogbeitrag veröffentlicht, der einen Harness-Design-Ansatz zur Verbesserung von Claudes Leistung bei langlaufenden Programmieraufgaben skizziert. Die Methode behandelt zwei spezifische Probleme: Kontextangst (Verlust der Kohärenz über längere Zeiträume) und Selbstbewertungsverzerrung (Claude lobt seine eigene Arbeit, auch wenn die Qualität schlecht ist).
Multi-Agenten-Lösung
Die Lösung setzt mehrere zusammenarbeitende Agenten um, inspiriert von GANs (Generative Adversarial Networks). Die Kernstruktur umfasst:
- Generator: Erstellt Code und Design
- Evaluator: Bietet kritische Bewertung und Feedback
Frontend-Implementierung
Für die Frontend-Entwicklung verwendet das Harness 4 Bewertungskriterien, die Ästhetik und Kreativität betonen, um generische Designs zu vermeiden. Der Prozess umfasst 5-15 Überarbeitungen, was zu schöneren und einzigartigeren Ergebnissen führt.
Full-Stack-Implementierung
Für die Full-Stack-Entwicklung setzt das Harness 3 Agenten ein:
- Planer
- Generator
- Evaluator
Leistungsvergleich
Der Artikel vergleicht Ergebnisse für dieselben Spielentwicklungsanforderungen:
- Allein laufen: Schnelle Ausführung, aber das Spiel hat schwerwiegende Fehler
- Mit Harness: Zeitaufwändiger und teurer, aber produziert deutlich höherwertige Ergebnisse, einschließlich schöner Oberfläche, spielbarem Spiel und hinzugefügter KI-Unterstützung
Der Artikel schlägt vor, dass, wenn Modelle leistungsfähiger werden (speziell Opus 4.6 erwähnt), unnötige Harness-Elemente entfernt werden sollten.
📖 Read the full source: r/ClaudeAI
👀 Siehe auch

Echte Einblicke in die Verwendung von OpenClaw mit LLMs: Herausforderungen und Einschränkungen
Ein OpenClaw-Nutzer beschreibt Integrationsprobleme mit LLMs und berichtet von unsinnigen Antworten eines Discord-Bots.

OpenClaw Outlook-Add-in verbindet lokalen Agent mit E-Mail-Sidebar
Ein Entwickler hat ein Outlook-Add-in erstellt, das über WebSocket mit einem lokalen OpenClaw Gateway verbindet und vollen Agentenzugriff mit Tools und Automatisierungen direkt in der E-Mail-Seitenleiste bietet. Das Tool liest ausgewählte E-Mails als Kontext, verwaltet Chat-Sitzungen pro E-Mail und funktioniert mit Outlook Desktop und Web.

Relay: Open-Source-Steuerungsebene für OpenClaw-KI-Agenten
Relay ist eine Electron-Desktop-App, die einen Claude-Cowork-ähnlichen Workflow für OpenClaw bietet, auf Ihrer Infrastruktur läuft, Ihre Wahl von LLM-Modellen unterstützt und integrierte Governance-Funktionen wie Freigabeschleusen und exportierbare Prüfpfade umfasst.

OpenClaw Claude-Erweiterung nach Änderungen bei der Anthropic-Abrechnung auf Agent SDK aktualisiert
Ein OpenClaw-Erweiterungsentwickler hat seine Claude-CLI-Integration neu geschrieben, um das offizielle claude-agent-sdk zu verwenden, nachdem Anthropic begonnen hatte, die CLI-Nutzung zu erkennen und als Nutzung durch Drittanbieter-Applikationen neu zu klassifizieren, was gegen einen separaten Guthabenpool anstatt gegen die Max-Plan-Limits abgerechnet wird. Der SDK-Ansatz authentifiziert sich über die bestehende Claude-Code-Anmeldung und rechnet als reguläre Max-Plan-Nutzung ab.