Garde du raisonnement : Détection de boucle au niveau proxy pour l'inférence LLM locale

✍️ OpenClawRadar📅 Publié: April 30, 2026🔗 Source
Garde du raisonnement : Détection de boucle au niveau proxy pour l'inférence LLM locale
Ad

Un développeur exécutant Qwen3.6 MoE derrière un proxy vLLM a rencontré un problème de fiabilité courant : des boucles de raisonnement incontrôlées où le modèle se répète à l'intérieur d'un bloc de raisonnement, brûlant des jetons et bloquant les agents. À 180+ jetons/seconde, même une boucle de 20 à 30 secondes gaspille du temps GPU et bloque les requêtes des clients. Ils ont construit un gardien léger qui réside dans la couche proxy et applique des contrôles déterministes sur le flux de sortie avant qu'il n'atteigne le client.

Architecture

Client → Proxy → vLLM → Modèle

Le proxy intercepte la réponse en streaming à sa sortie de vLLM. Il ne modifie pas les poids du modèle, n'appelle pas un second LLM, et n'utilise ni embeddings ni analyse sémantique. Tous les contrôles sont peu coûteux et déterministes.

Ce qu'il vérifie

  • Plafonds de jetons de raisonnement (configurables par niveau d'effort)
  • Détection de paragraphes répétés
  • Répétition de n-grammes par fenêtre glissante
  • Empreintes de phrases répétées
  • Détection floue de motifs d'ouverture (capture des boucles comme « En fait, je pense que je l'ai trouvé… »)
  • Chemin de récupération couper-et-continuer
Ad

Flux de récupération

Lorsque le gardien se déclenche, il :

  • Arrête le flux en amont
  • Capture le raisonnement produit jusqu'à présent
  • Réémet la requête avec ce raisonnement intégré comme contexte d'assistant antérieur
  • Désactive la réflexion pour la suite
  • Fusionne les statistiques d'utilisation des phases 1 et 2

Comme la mise en cache de préfixe vLLM est déjà active, la suite est effectivement transparente. La phase 2 reprend généralement avec un TTFT d'environ 50 à 100 ms, de sorte que le client voit le raisonnement s'écouler directement dans la réponse finale au lieu de bloquer.

Observabilité

Le proxy enregistre chaque déclenchement avec :

  • Si le gardien s'est déclenché
  • Raison du déclenchement
  • Plafond de jetons utilisé
  • Nombre de jetons de raisonnement
  • Utilisation totale fusionnée
  • Métadonnées de fin de flux

Résultat

Avant : des blocs de raisonnement occasionnels de 2000+ jetons qui ne menaient nulle part. Après : le modèle raisonne encore lorsque c'est utile, mais les pensées incontrôlées sont coupées et redirigées vers une réponse. L'auteur le décrit comme une « ceinture de sécurité au niveau proxy pour l'inférence LLM locale ».

Pas de chirurgie du modèle, pas d'appels LLM supplémentaires — juste une interception de flux, un comptage de jetons, une détection de boucle et un chemin de récupération propre. Le gardien a été validé de bout en bout via le proxy en direct avec des journaux de traces réels.

📖 Lire la source complète : r/LocalLLaMA

Ad

👀 See Also

Analyste de Données Crée un Outil de Calibration de Prompts avec Claude, Sans Expérience Préalable en Frontend
Tools

Analyste de Données Crée un Outil de Calibration de Prompts avec Claude, Sans Expérience Préalable en Frontend

Un analyste de données sans expérience en HTML, CSS ou JavaScript a créé Prompt Calibrator, un outil web côté client qui structure les invites d'IA via un formulaire avec quatre champs et quatre modes. L'outil a été développé en utilisant Claude comme partenaire de revue de code et est hébergé sur GitHub Pages.

OpenClawRadar
Classement des modèles votés par la communauté pour OpenClaw publié
Tools

Classement des modèles votés par la communauté pour OpenClaw publié

Un nouveau classement élu par la communauté pour les modèles compatibles avec OpenClaw est désormais disponible, Opus 4.5 occupant actuellement la première place.

OpenClawRadar
Antigravité 2.0 domine le benchmark architectural 3D OpenSCAD – ModelRift teste 6 LLM sur le Panthéon
Tools

Antigravité 2.0 domine le benchmark architectural 3D OpenSCAD – ModelRift teste 6 LLM sur le Panthéon

ModelRift a testé 6 LLM pour construire le Panthéon en OpenSCAD. Antigravity a obtenu 4,5/5 en qualité architecturale, battant le baseline Codex 5.5. Cursor 3.5 était le plus rapide mais le plus faible.

OpenClawRadar
Utilisation de Claude pour automatiser le contrôle qualité d'applications mobiles avec les WebViews Capacitor
Tools

Utilisation de Claude pour automatiser le contrôle qualité d'applications mobiles avec les WebViews Capacitor

Un développeur a créé un système de QA automatisé utilisant Claude pour tester une application mobile basée sur Capacitor sur Android et iOS. L'approche utilise le Chrome DevTools Protocol pour les WebViews Android et des captures d'écran pour l'analyse visuelle, avec une configuration Android prenant 90 minutes contre plus de 6 heures pour iOS.

OpenClawRadar