Garde du raisonnement : Détection de boucle au niveau proxy pour l'inférence LLM locale

✍️ OpenClawRadar📅 Publié: April 30, 2026🔗 Source
Garde du raisonnement : Détection de boucle au niveau proxy pour l'inférence LLM locale
Ad

Un développeur exécutant Qwen3.6 MoE derrière un proxy vLLM a rencontré un problème de fiabilité courant : des boucles de raisonnement incontrôlées où le modèle se répète à l'intérieur d'un bloc de raisonnement, brûlant des jetons et bloquant les agents. À 180+ jetons/seconde, même une boucle de 20 à 30 secondes gaspille du temps GPU et bloque les requêtes des clients. Ils ont construit un gardien léger qui réside dans la couche proxy et applique des contrôles déterministes sur le flux de sortie avant qu'il n'atteigne le client.

Architecture

Client → Proxy → vLLM → Modèle

Le proxy intercepte la réponse en streaming à sa sortie de vLLM. Il ne modifie pas les poids du modèle, n'appelle pas un second LLM, et n'utilise ni embeddings ni analyse sémantique. Tous les contrôles sont peu coûteux et déterministes.

Ce qu'il vérifie

  • Plafonds de jetons de raisonnement (configurables par niveau d'effort)
  • Détection de paragraphes répétés
  • Répétition de n-grammes par fenêtre glissante
  • Empreintes de phrases répétées
  • Détection floue de motifs d'ouverture (capture des boucles comme « En fait, je pense que je l'ai trouvé… »)
  • Chemin de récupération couper-et-continuer
Ad

Flux de récupération

Lorsque le gardien se déclenche, il :

  • Arrête le flux en amont
  • Capture le raisonnement produit jusqu'à présent
  • Réémet la requête avec ce raisonnement intégré comme contexte d'assistant antérieur
  • Désactive la réflexion pour la suite
  • Fusionne les statistiques d'utilisation des phases 1 et 2

Comme la mise en cache de préfixe vLLM est déjà active, la suite est effectivement transparente. La phase 2 reprend généralement avec un TTFT d'environ 50 à 100 ms, de sorte que le client voit le raisonnement s'écouler directement dans la réponse finale au lieu de bloquer.

Observabilité

Le proxy enregistre chaque déclenchement avec :

  • Si le gardien s'est déclenché
  • Raison du déclenchement
  • Plafond de jetons utilisé
  • Nombre de jetons de raisonnement
  • Utilisation totale fusionnée
  • Métadonnées de fin de flux

Résultat

Avant : des blocs de raisonnement occasionnels de 2000+ jetons qui ne menaient nulle part. Après : le modèle raisonne encore lorsque c'est utile, mais les pensées incontrôlées sont coupées et redirigées vers une réponse. L'auteur le décrit comme une « ceinture de sécurité au niveau proxy pour l'inférence LLM locale ».

Pas de chirurgie du modèle, pas d'appels LLM supplémentaires — juste une interception de flux, un comptage de jetons, une détection de boucle et un chemin de récupération propre. Le gardien a été validé de bout en bout via le proxy en direct avec des journaux de traces réels.

📖 Lire la source complète : r/LocalLLaMA

Ad

👀 See Also

Qhatu : La plateforme transforme les dépôts GitHub en micro SaaS payants à l'usage avec Claude
Tools

Qhatu : La plateforme transforme les dépôts GitHub en micro SaaS payants à l'usage avec Claude

Qhatu est une plateforme qui prend un dépôt GitHub et le déploie en tant que micro SaaS à l'usage avec paiement à l'utilisation, dotée d'une interface générée automatiquement et d'un traitement de paiement intégré. Le système utilise les API d'Anthropic pour analyser le code, générer des Dockerfiles et créer des interfaces de boutique en ligne.

OpenClawRadar
Conseiller : Une commande slash /advisor pour Claude Code qui exécute Opus et des runners Sonnet parallèles
Tools

Conseiller : Une commande slash /advisor pour Claude Code qui exécute Opus et des runners Sonnet parallèles

Une commande /advisor pour Claude Code utilise Opus comme stratège coordonnant plusieurs exécuteurs Sonnet lisant des fichiers en parallèle. A trouvé 6 bugs réels dont un trou de source trojan bidi.

OpenClawRadar
Le goulot d'étranglement dans les agents IA parallèles : la file d'attente d'approbation humaine
Tools

Le goulot d'étranglement dans les agents IA parallèles : la file d'attente d'approbation humaine

Un développeur exécutant des agents Claude Code en parallèle décrit le « bottleself » — le point où le parallélisme cesse d'augmenter la production et commence à créer un backlog d'approbations humaines. Sa solution : un planificateur qui décompose les objectifs en sous-tâches, lance des agents, et n'interrompt que pour les décisions non résolues.

OpenClawRadar
AI Claw : Le pont sans serveur connecte Alexa à OpenClaw local avec livraison double.
Tools

AI Claw : Le pont sans serveur connecte Alexa à OpenClaw local avec livraison double.

AI Claw est un pipeline Python AWS Lambda qui connecte les enceintes Amazon Echo aux instances locales d'OpenClaw, contournant le délai d'attente de 8 secondes d'Amazon grâce à une architecture de type « fire-and-forget » avec double livraison vers Telegram et la sortie audio native de l'Echo.

OpenClawRadar