SOPHIA Meta-Agent für die Wartung von KI-Agenten

SOPHIA ist ein Meta-Agent, der entwickelt wurde, um das praktische Problem der Verschlechterung von KI-Agenten in Produktionsökosystemen anzugehen. Bei der Ausführung von Agenten für Vertrieb, klinische Dokumentation und Kundenservice können Prompts veralten, Tools sich verschieben und sich das Nutzerverhalten im Laufe der Zeit ändern. SOPHIA fungiert als Chief Learning Officer, der jeden anderen Agenten im System beobachtet, diagnostiziert, erforscht und Verbesserungen vorschlägt.
Designprozess und technische Beiträge
Der Meta-Agent wurde durch einen experimentellen Prozess mit 4 Frontier-Modellen über 7 Iterationen hinweg entwickelt:
- Claude → Gemini → ChatGPT → Grok, wobei jedes Modell auf der vorherigen Version aufbaut
- Peer-Review über alle drei Modelle, Priorisierung und finale Integration
Wichtige technische Beiträge nach Modell:
- Gemini: Actor-Critic-Paradigma (Agenten als Akteure, Sophia als Kritiker)
- ChatGPT: Anti-Goodhart-Schutzmaßnahmen, Tool-Vertragsregister, Reproduzierbarkeit
- Grok: Evolver (evolutionäre Prompt-Suche), Agent-as-Judge, Meta-Sophia
Operative Details
Das System erfordert für alle Änderungen eine menschliche Genehmigung – keine Bereitstellung erfolgt ohne ausdrückliche Freigabe. Dies stellt sicher, dass SOPHIA zwar Verbesserungen vorschlagen kann, die menschliche Aufsicht jedoch die Kontrolle über die Produktionsumgebung behält.
Der vollständige Designprozess und Implementierungsdetails sind im Projekt-Repository dokumentiert, das den iterativen Entwicklungsansatz und die spezifischen Beiträge jedes im Design verwendeten Modells enthält.
📖 Read the full source: r/LocalLLaMA
👀 Siehe auch

Claude Code Plugin /verify: Automatisierte Browser-Tests aus Ihrem Plan
/verify ist ein Open-Source-Claude-Code-Plugin, das Ihren Plan liest, einen echten Browser über Playwright MCP startet, jede Anforderung prüft und Ihnen einen Bestanden/Nicht bestanden-Bericht mit Screenshots liefert.

Claude Code Plugin analysiert Token-Verschwendung und Anomalien lokal
Ein Entwickler hat ein Claude Code Plugin erstellt, das Token-Verschwendung diagnostiziert, indem es sechs Anomaliearten aus lokalen Sitzungsdaten erkennt. Das Tool analysierte 8.392 Sitzungen und fand 1.015 Anomalien, wobei ExcessiveToolUse am häufigsten auftrat.

MCP-Server: Vergleich von lokalen und Cloud-LLMs mit Debattierfunktion
Der MCP-Server ermöglicht Entwicklern, lokale Modelle über Ollama neben verschiedenen Cloud-LLMs abzufragen, und bietet Funktionen wie einen Vergleich nebeneinander und eine strukturierte Debattenfunktion.

tmux-claude: Überwachen Sie Claude-Code-Instanzen über Tmux-Fenster hinweg
tmux-claude ist ein Tool, das eine Live-Überwachung für Claude Code-Instanzen innerhalb von tmux-Sitzungen hinzufügt. Es bietet eine Statusleiste, ein interaktives Dashboard, einen erweiterten Fensterauswähler und Desktop-Benachrichtigungen, indem es lokale Sitzungsdateien ohne API-Aufrufe liest.