Recherche Automatisée avec Claude Code sur la Base de Code de Production : 60 Expériences, 3 Modifications Conservées

Expérience d'autorecherche sur une base de code en production
Un développeur a testé l'approche d'autorecherche de Karpathy sur un système de production réel en utilisant Claude Code, exécutant 60 itérations sur deux tours de tests tout en étant absent de l'ordinateur. La cible était un système de recherche hybride construit avec Django, pgvector et les intégrations Cohere.
Résultats et découvertes clés
Sur 60 itérations, seules 3 modifications ont été conservées tandis que 57 ont été annulées. L'amélioration globale du score était marginale (+0,03), mais les connaissances acquises étaient significatives :
- La correspondance des titres comme signal de recherche s'est avérée globalement négative, démontrée en seulement 2 itérations
- Des pools de candidats plus grands n'ont eu aucun effet - le problème était le classement, pas le rappel
- La pondération adaptative construite manuellement a réellement fonctionné - la supprimer a causé des régressions
- Modifier les formules d'amortissement des mots-clés a à peine fait bouger les scores
- Le tour 2 ciblant l'invite de métadonnées Haiku n'a donné aucune amélioration car les poids de classement du tour 1 étaient co-optimisés pour la sortie de l'invite originale
- Découverte d'un bug de mise en cache Redis : les clés étaient basées sur le hachage de la requête, pas sur le hachage de l'invite, ce qui aurait été déployé en production sans être remarqué
Retours d'expérience pratiques
La plus grande leçon était que l'autorecherche aide à cartographier où se trouve le plafond, pas seulement à trouver des améliorations. Avoir 60 points de données disant "Vous pouvez arrêter d'ajuster cela" fournit des preuves concrètes plutôt que de s'appuyer sur l'intuition. Le développeur note que cette approche a permis d'économiser du temps d'expérimentation manuelle sur des optimisations qui n'auraient pas été rentables.
Le compte-rendu complet est disponible sur le lien du blog, et la compétence d'autorecherche open source Claude Code est sur GitHub. Le développeur est curieux de savoir si d'autres ont essayé cela sur des bases de code non-ML et quelles métriques ils utilisent.
📖 Read the full source: r/ClaudeAI
👀 See Also

Configuration OpenClaw bon marché : VPS Hetzner à 5 $/mois + API DeepSeek pour moins de 1 $
Un utilisateur de Reddit partage une configuration OpenClaw pratique utilisant un VPS Hetzner à 5$/mois, l'API DeepSeek (crédit de 5$), un bot Telegram, Grafana et Netdata — le tout coûtant environ 1$ jusqu'à présent.

Plateforme de jeux de rôle B2B utilise Opus 4.7 pour le backend, Haiku 4.5 pour le chat en direct
Socratize (socratize.io) utilise Opus 4.7 pour l'orchestration et l'évaluation des gains/pertes, et Haiku 4.5 pour le chat en temps réel grâce à une meilleur amabilité et un coût réduit.

Construire un Traqueur de Licenciements en IA avec Claude Cowork : Détails de Mise en Œuvre Pratique
Un développeur a créé un suivi interactif en temps réel des licenciements qui collecte et affiche chaque entreprise citant l'IA comme raison des suppressions d'emplois en 2026, en utilisant Claude Cowork pour générer les structures de tableaux, déboguer la logique des filtres et optimiser l'accessibilité mobile.

Leçons pratiques tirées du déploiement de bots RAG dans les secteurs réglementés
Un développeur partage des leçons durement acquises lors du déploiement d'assistants IA alimentés par RAG pour la conformité en milieu de travail australien dans les secteurs de la construction, des soins aux personnes âgées et des opérations minières. Les principaux enseignements incluent des techniques d'expansion de requêtes, la correspondance des titres de documents, l'empilement d'invites et les décisions d'infrastructure.