Selbstentwickelnde Fähigkeitsmuster-Validierung: Ergebnisse des 5-Runden-Experiments

Experimentaufbau und Ergebnisse
Ein Entwickler führte ein 5-Runden-Experiment durch, um das Self-Evolving Skill-Designmuster für Claude Code zu validieren, das zuvor geteilt wurde. Das Experiment verwendete eine MySQL-Datenbank mit 29 Tabellen und 590 MB Daten aus einem Smart-Building-Management-System.
Die Runden folgten diesem Verlauf: Strukturerkundung → Datenabfragen → Regelentdeckung → komplexe Untersuchung → Wiederholungsüberprüfung.
Wichtige Erkenntnisse
- Five-Gate-Ablehnungsrate: 63,6 % – die meisten Interaktionen führten zu keiner Wissensänderung
- Inkrementelle Konvergenz: +75 → +46 → +12 → +21 → +1
- Gate 2 Selbstkorrektur: Das Muster erkannte und korrigierte 2 fehlerhafte Regeln, die die Skill in früheren Runden geschrieben hatte
- Runde 5: Null Erkundungsschritte, direkte Wiederverwendung von Vorlagen
- Genauigkeit: 100 % – kein falsches Wissen überlebte den Prozess
Eine unerwartete Erkenntnis war, dass Fallstricke bei der Werkzeugnutzung als wertvolles Nebenprodukt erfasst wurden – Probleme, für die der Entwickler nicht geplant hatte, die aber von den Five Gates trotzdem erkannt wurden.
Der Entwickler hat ein zweites Experiment an einer größeren Telefonrechnungsdatenbank in Arbeit. Vollständige Daten mit pro Runde differenzierbaren Momentaufnahmen sind auf GitHub verfügbar.
📖 Read the full source: r/ClaudeAI
👀 Siehe auch

SimSense MCP Connector verleiht Claude-Artefakten permanente URLs mit persistentem Zustand
SimSense ist ein MCP-Connector, der es Claude ermöglicht, generierte HTML/JS-Artefakte auf permanente URLs namens 'Sims' mit dauerhafter Zustandsspeicherung bereitzustellen. Das Tool behebt die Einschränkung, dass Claudes Ausgaben verschwinden, wenn Sie das Chatfenster schließen.

"Sitzungsspeicher-Funktion in Claude Code eingeführt"
Claude Code umfasst jetzt eine Funktion zur 'Sitzungsspeicherung', die Sitzung Zusammenfassungen in summary.md Dateien generiert und verwaltet. Schalte sie mit tweakcc für interaktive Sitzungen frei, die bestimmte Token- und Toolaufrufschwellen überschreiten.

KI-Handelsagent mit Risikobegrenzungen für Bildungsinvestitionen
Ein Entwickler hat einen KI-gestützten Handelsassistenten gebaut, der Claude mit einem Brokerage-Konto verbindet, wobei eine Risiko-Engine zwischen der KI und dem Geld positioniert ist. Das System umfasst Sicherheitsprüfungen wie das Blockieren von Trades, die 50 % der Portfoliostruktur überschreiten, eine automatische Abschaltung bei 3 % Tagesverlust und einen Notausschalter bei 20 % Verlust.

Dual DGX Sparks vs. Mac Studio M3 Ultra: Praktischer Vergleich für den lokalen Betrieb von Qwen3.5 397B
Ein Entwickler verglich das lokale Ausführen von Qwen3.5 397B auf einem 10.000 US-Dollar teuren Mac Studio M3 Ultra 512GB und einem 10.000 US-Dollar teuren Dual-DGX-Spark-Setup. Das Mac Studio erreichte 30–40 Tok/s mit 800 GB/s Bandbreite, aber langsamer Vorauffüllung, während die Sparks 27–28 Tok/s mit schnellerer Rechenleistung, aber komplexer Einrichtung lieferten.