Leçons pratiques tirées du déploiement de bots RAG dans les secteurs réglementés

Détails clés de mise en œuvre
Cette étude de cas couvre le déploiement d'un assistant IA alimenté par RAG pour des cas d'utilisation de conformité en milieu de travail australien sur les chantiers de construction, dans les établissements de soins aux personnes âgées et les opérations minières.
Leçons techniques apprises
- L'expansion des requêtes compte plus que la taille des segments : Plutôt que de s'obséder sur la taille des segments (400 mots ? 512 tokens ?), le développeur a constaté que générer 4 formulations alternatives de chaque requête via Haiku, exécuter les 4 contre ChromaDB, puis fusionner et dédupliquer les résultats améliorait significativement la qualité de la récupération. Cela était particulièrement efficace pour le jargon spécifique au domaine où les utilisateurs formulent les choses différemment des auteurs des documents.
- Renforcement de la source pour les documents nommés : Si la requête d'un utilisateur contient des mots qui correspondent au titre d'un document indexé, inclure de force les segments de ce document indépendamment de la similarité sémantique. Par exemple, "Que dit notre politique FIFO concernant les vols R&R ?" devrait toujours extraire des informations de la politique FIFO — et pas seulement des segments sémantiquement similaires qui mentionnent par hasard des vols.
- Superposez vos invites — ne laissez pas les clients contourner la Couche 1 : Mise en place d'un système à trois couches : règles de sécurité/de sûreté fondamentales (immuables), personnalité verticale (échangeable par industrie), instructions personnalisées du client (additives uniquement). Les clients ne peuvent pas outrepasser la Couche 1 via leurs instructions personnalisées. Cela a empêché les attaques de type "ignorez les instructions précédentes" et les clients de libérer accidentellement leurs propres bots.
- Les embeddings locaux sont suffisants : Utilisation de sentence-transformers all-MiniLM-L6-v2 exécuté localement sur ChromaDB sans API d'embedding externe. Pour le Q&A de documents dans un domaine spécifique, il performe suffisamment proche d'ada-002 pour que les économies de coût et de latence en valent la peine. La qualité du LLM (Claude Haiku) fait de toute façon plus de travail que les embeddings.
- Une droplet par client : Tentative d'infrastructure partagée d'abord, mais constatation que la surcharge opérationnelle de garder les collections ChromaDB isolées, de gérer les clés API et d'empêcher la contamination croisée était pire que de simplement lancer une VM à 6$/mois par client. Chaque client possède son propre magasin de vecteurs, et ses documents ne touchent jamais l'infrastructure partagée.
Le développeur a rendu le moteur RAG disponible sur GitHub pour que d'autres puissent l'examiner.
📖 Read the full source: r/LocalLLaMA
👀 See Also

Cas d'utilisation de l'agent OpenClaw : de l'automatisation DevOps au renseignement
Un développeur partage six tâches spécifiques que son agent OpenClaw gère quotidiennement, incluant les opérations serveur via des commandes Discord, le filtrage d'emails sur huit comptes, l'analyse de contenu Reddit, la configuration d'analytiques PostHog, la gestion de serveur Discord, et les opérations de base de connaissances d'entreprise dans Feishu.

Audit de la bibliothèque React à 80 composants par Claude Code : des bugs réels découverts, un nouveau bug introduit
Un ingénieur staff a utilisé Claude Code pour auditer la documentation d'une bibliothèque React de 80 composants. L'IA a détecté de vrais bugs mais en a aussi introduit de nouveaux, nécessitant une relecture.

Développeur crée une visualisation 3D de ville GitHub en utilisant Claude Code en une journée
Un développeur a créé Git City, une visualisation 3D où chaque utilisateur de GitHub devient un bâtiment en pixel art. Le projet a été construit à 100 % avec Claude Code dans VS Code, sans codage manuel, et la première version a été terminée en une journée.

OpenClaw Agent automatise le pipeline complet de contenu vidéo avec Remotion et Hyperframes
Un utilisateur a construit un agent sur OpenClaw qui gère les systèmes de fichiers, génère des images, les anime, recherche des histoires et produit des vidéos complètes en utilisant Remotion et Hyperframes — le tout automatisé et reproductible.