Autoresearch mit Claude Code in Produktionscodebasis: 60 Experimente, 3 Änderungen behalten

✍️ OpenClawRadar📅 Veröffentlicht: 24. März 2026🔗 Source
Autoresearch mit Claude Code in Produktionscodebasis: 60 Experimente, 3 Änderungen behalten
Ad

Autoresearch-Experiment an einem Produktiv-Codebase

Ein Entwickler testete Karpathys Autoresearch-Ansatz an einem echten Produktivsystem mit Claude Code, führte 60 Iterationen in zwei Runden durch, während er nicht am Computer war. Das Ziel war ein Hybrid-Suchsystem, das mit Django, pgvector und Cohere-Embeddings aufgebaut wurde.

Wichtige Ergebnisse und Erkenntnisse

Von 60 Iterationen wurden nur 3 Änderungen beibehalten, während 57 rückgängig gemacht wurden. Die Gesamtverbesserung der Bewertung war geringfügig (+0,03), aber die gewonnenen Erkenntnisse waren bedeutend:

  • Titelabgleich als Suchsignal erwies sich als negativ, was in nur 2 Iterationen demonstriert wurde
  • Größere Kandidatenpools hatten keine Wirkung – das Problem lag im Ranking, nicht im Recall
  • Manuell erstellte adaptive Gewichtung funktionierte tatsächlich – ihre Entfernung führte zu Rückschritten
  • Herumspielen mit Dämpfungsformeln für Keywords bewegte die Bewertungen kaum
  • Runde 2, die auf den Haiku-Metadaten-Prompt abzielte, erbrachte keine Verbesserungen, da die Ranking-Gewichtungen aus Runde 1 auf die Ausgabe des ursprünglichen Prompts abgestimmt waren
  • Entdeckung eines Redis-Caching-Fehlers: Schlüssel basierten auf Query-Hash, nicht auf Prompt-Hash, was unentdeckt in die Produktion gegangen wäre
Ad

Praktische Erkenntnisse

Die wichtigste Einsicht war, dass Autoresearch hilft, die Grenzen aufzuzeigen, nicht nur Verbesserungen zu finden. 60 Datenpunkte, die sagen „Du kannst damit aufhören, dies zu optimieren“, liefern konkrete Beweise statt sich auf Intuition zu verlassen. Der Entwickler merkt an, dass dieser Ansatz manuelle Experimentierzeit für Optimierungen sparte, die sich nicht ausgezahlt hätten.

Der vollständige Bericht ist über den Blog-Link verfügbar, und die Open-Source-Claude-Code-Autoresearch-Funktion ist auf GitHub. Der Entwickler ist neugierig, ob andere dies an Nicht-ML-Codebases ausprobieren und welche Metriken sie verwenden.

📖 Read the full source: r/ClaudeAI

Ad

👀 Siehe auch

Linke Argumente für KI: Behinderung, chronische Krankheit und Klasse
Anwendungsfälle

Linke Argumente für KI: Behinderung, chronische Krankheit und Klasse

Sean Goedecke argumentiert, dass LLMs linke Werte unterstützen, indem sie behinderten Menschen helfen, Patienten mit chronischen Krankheiten bei der Bewältigung medizinischer Hürden unterstützen und Klassen-Code-Switching zur bürokratischen Sprache ermöglichen.

OpenClawRadar
Entwickler erstellt 6 iOS-Apps in 3 Monaten mit Claude Code und generiert Einnahmen
Anwendungsfälle

Entwickler erstellt 6 iOS-Apps in 3 Monaten mit Claude Code und generiert Einnahmen

Ein Entwickler nutzte Claude Code, um in 3 Monaten 6 iOS-Utility-Apps zu erstellen und zu veröffentlichen, wobei der Fokus auf der Lösung kleiner realer Probleme lag, nicht auf Perfektion. Die Apps generieren jetzt täglich Nutzung und Einnahmen.

OpenClawRadar
OpenClaw Assistant erstellt Dockerisierten Terminal-Assistenten mit Benutzerdefiniertem Routing
Anwendungsfälle

OpenClaw Assistant erstellt Dockerisierten Terminal-Assistenten mit Benutzerdefiniertem Routing

Ein OpenClaw-Benutzer berichtet, dass sein Hauptassistent geholfen hat, einen zweiten Assistenten innerhalb von Docker mit eigenem Arbeitsbereich, Speicher und terminalorientiertem Verhalten einzurichten. Nachrichten, die mit 'meow:' beginnen, werden an den containerisierten Terminal-Assistenten weitergeleitet statt an die Haupt-Chat-Oberfläche.

OpenClawRadar
Aufbau einer 20-Agenten-Pipeline mit Claude Code: Weniger KI, mehr Struktur
Anwendungsfälle

Aufbau einer 20-Agenten-Pipeline mit Claude Code: Weniger KI, mehr Struktur

Ein Entwickler baute eine 20-Agenten-Pipeline mit Claude Code, um tägliche Arbeitsabläufe über Gmail, Kalender, Notion, LinkedIn, Web-Scraper und lokale APIs zu automatisieren. Die entscheidende Erkenntnis: Die Zuverlässigkeit kam durch das Hinzufügen deterministischer Struktur um die KI, nicht durch bessere Prompts.

OpenClawRadar