Recherche Automatisée avec Claude Code sur la Base de Code de Production : 60 Expériences, 3 Modifications Conservées

Expérience d'autorecherche sur une base de code en production
Un développeur a testé l'approche d'autorecherche de Karpathy sur un système de production réel en utilisant Claude Code, exécutant 60 itérations sur deux tours de tests tout en étant absent de l'ordinateur. La cible était un système de recherche hybride construit avec Django, pgvector et les intégrations Cohere.
Résultats et découvertes clés
Sur 60 itérations, seules 3 modifications ont été conservées tandis que 57 ont été annulées. L'amélioration globale du score était marginale (+0,03), mais les connaissances acquises étaient significatives :
- La correspondance des titres comme signal de recherche s'est avérée globalement négative, démontrée en seulement 2 itérations
- Des pools de candidats plus grands n'ont eu aucun effet - le problème était le classement, pas le rappel
- La pondération adaptative construite manuellement a réellement fonctionné - la supprimer a causé des régressions
- Modifier les formules d'amortissement des mots-clés a à peine fait bouger les scores
- Le tour 2 ciblant l'invite de métadonnées Haiku n'a donné aucune amélioration car les poids de classement du tour 1 étaient co-optimisés pour la sortie de l'invite originale
- Découverte d'un bug de mise en cache Redis : les clés étaient basées sur le hachage de la requête, pas sur le hachage de l'invite, ce qui aurait été déployé en production sans être remarqué
Retours d'expérience pratiques
La plus grande leçon était que l'autorecherche aide à cartographier où se trouve le plafond, pas seulement à trouver des améliorations. Avoir 60 points de données disant "Vous pouvez arrêter d'ajuster cela" fournit des preuves concrètes plutôt que de s'appuyer sur l'intuition. Le développeur note que cette approche a permis d'économiser du temps d'expérimentation manuelle sur des optimisations qui n'auraient pas été rentables.
Le compte-rendu complet est disponible sur le lien du blog, et la compétence d'autorecherche open source Claude Code est sur GitHub. Le développeur est curieux de savoir si d'autres ont essayé cela sur des bases de code non-ML et quelles métriques ils utilisent.
📖 Read the full source: r/ClaudeAI
👀 See Also

Un agent OpenClaw gère une panne d'électricité : coordination solaire, Powerwalls et humaine
Un agent OpenClaw nommé Sam a lu un avis de panne d'électricité, a préchargé les Tesla Powerwalls, a surveillé le solaire et la batterie, et a coordonné avec deux humains pour ajuster l'utilisation de la climatisation et éviter l'épuisement de la batterie avant le retour du courant.

Patient cardiaque de 73 ans crée une PWA de suivi de santé avec Claude AI
Une personne de 73 ans sans expérience en programmation et souffrant de multiples problèmes cardiaques a créé ClinBridge, une Progressive Web App pour le suivi de santé, en utilisant Claude AI. L'application suit la tension artérielle, l'apport hydrique, le poids, la fréquence cardiaque, les symptômes, les repas et les activités, fonctionne complètement hors ligne et est open source.

Parallélisation massive du code Claude : Leçons tirées de la construction d'une application de 220 000 lignes
Un développeur sans formation formelle en programmation a créé une application mobile full-stack en utilisant Claude Code, en exécutant 3 à 4 instances parallèles pour traiter 4 milliards de tokens sur plus de 500 fichiers. Les techniques clés incluent des documents de transfert, des fichiers CLAUDE.md, des commandes slash personnalisées et des audits systématiques du code source.

Utiliser les sujets Telegram pour des conversations parallèles illimitées avec des agents IA
Un développeur a découvert que la conversion de groupes Telegram en forums permet à chaque sujet de fonctionner comme une session isolée pour les agents d'IA, permettant des conversations parallèles illimitées sans créer de bots ou de jetons supplémentaires.