Leçons pratiques tirées du déploiement de bots RAG dans les secteurs réglementés

Détails clés de mise en œuvre
Cette étude de cas couvre le déploiement d'un assistant IA alimenté par RAG pour des cas d'utilisation de conformité en milieu de travail australien sur les chantiers de construction, dans les établissements de soins aux personnes âgées et les opérations minières.
Leçons techniques apprises
- L'expansion des requêtes compte plus que la taille des segments : Plutôt que de s'obséder sur la taille des segments (400 mots ? 512 tokens ?), le développeur a constaté que générer 4 formulations alternatives de chaque requête via Haiku, exécuter les 4 contre ChromaDB, puis fusionner et dédupliquer les résultats améliorait significativement la qualité de la récupération. Cela était particulièrement efficace pour le jargon spécifique au domaine où les utilisateurs formulent les choses différemment des auteurs des documents.
- Renforcement de la source pour les documents nommés : Si la requête d'un utilisateur contient des mots qui correspondent au titre d'un document indexé, inclure de force les segments de ce document indépendamment de la similarité sémantique. Par exemple, "Que dit notre politique FIFO concernant les vols R&R ?" devrait toujours extraire des informations de la politique FIFO — et pas seulement des segments sémantiquement similaires qui mentionnent par hasard des vols.
- Superposez vos invites — ne laissez pas les clients contourner la Couche 1 : Mise en place d'un système à trois couches : règles de sécurité/de sûreté fondamentales (immuables), personnalité verticale (échangeable par industrie), instructions personnalisées du client (additives uniquement). Les clients ne peuvent pas outrepasser la Couche 1 via leurs instructions personnalisées. Cela a empêché les attaques de type "ignorez les instructions précédentes" et les clients de libérer accidentellement leurs propres bots.
- Les embeddings locaux sont suffisants : Utilisation de sentence-transformers all-MiniLM-L6-v2 exécuté localement sur ChromaDB sans API d'embedding externe. Pour le Q&A de documents dans un domaine spécifique, il performe suffisamment proche d'ada-002 pour que les économies de coût et de latence en valent la peine. La qualité du LLM (Claude Haiku) fait de toute façon plus de travail que les embeddings.
- Une droplet par client : Tentative d'infrastructure partagée d'abord, mais constatation que la surcharge opérationnelle de garder les collections ChromaDB isolées, de gérer les clés API et d'empêcher la contamination croisée était pire que de simplement lancer une VM à 6$/mois par client. Chaque client possède son propre magasin de vecteurs, et ses documents ne touchent jamais l'infrastructure partagée.
Le développeur a rendu le moteur RAG disponible sur GitHub pour que d'autres puissent l'examiner.
📖 Read the full source: r/LocalLLaMA
👀 See Also

Chauffeur de Fret Développe une Application iOS avec Claude Code, Partage des Leçons Pratiques
Un chauffeur routier au Japon, avec une expérience minimale en programmation, a utilisé Claude Code pour créer une application iOS afin de se conformer à de nouvelles réglementations de tenue de registres, l'ayant publiée sur l'App Store en six mois. Il partage des leçons spécifiques sur l'ingénierie des prompts, les coûts imprévus avec Expo et Supabase, et la gestion de l'épuisement professionnel.

Leçons pratiques tirées de la construction d'un agent IA pour le commerce électronique avec OpenClaw
Un développeur partage des informations spécifiques sur l'infrastructure, la sécurité et les flux de travail après avoir passé plus de 100 heures à construire un agent d'IA e-commerce avec OpenClaw, incluant la configuration d'un VPS sur Digital Ocean (24$/mois), la gestion des coûts des modèles avec Kimi K2.5 et Gemini Flash, et des recommandations d'architecture de mémoire.

L'analyse de Claude IA révèle un schéma 'Vous affinez pour éviter de terminer' dans les conversations des utilisateurs.
Un utilisateur a analysé six mois d'exportations de conversations avec Claude, en les recoupant avec des entrées de journal et des données de sommeil, découvrant un schéma comportemental où l'affinement sert d'évitement de l'achèvement. Claude a identifié des exemples spécifiques comme la génération de '20 textures uniques' pour un logo ou l'affinement de paroles de chanson à travers 'plusieurs itérations'.

Le modèle Qwen 27B démontre de solides performances pour l'analyse de lore en contexte long
Un utilisateur rapporte que Qwen 27B analyse efficacement des documents d'histoire denses de 80 000 tokens, surpassant d'autres modèles locaux comme Gemma 3 27B et Reka Flash pour des tâches détaillées de construction de mondes fantastiques. La quantification Q4-K-XL offre le meilleur équilibre vitesse/qualité pour les contextes longs.