Reasoning Guard: Proxy-Level Schleifenerkennung für lokale LLM-Inferenz

Ein Entwickler, der Qwen3.6 MoE hinter einem vLLM-Proxy betreibt, stieß auf ein häufiges Zuverlässigkeitsproblem: ausufernde Denkschleifen, in denen das Modell sich innerhalb eines Denkblocks wiederholt, Tokens verbrennt und Agents blockiert. Bei 180+ Tokens/s verschwendet selbst eine 20–30 Sekunden lange Schleife GPU-Zeit und blockiert Client-Anfragen. Sie entwickelten einen leichtgewichtigen Guard, der in der Proxy-Schicht lebt und deterministische Prüfungen auf den Streaming-Output anwendet, bevor dieser den Client erreicht.
Architektur
Client → Proxy → vLLM → Modell
Der Proxy fängt den Streaming-Response ab, sobald er vLLM verlässt. Er verändert keine Modellgewichte, ruft kein zweites LLM auf und verwendet weder Embeddings noch semantische Analysen. Alle Prüfungen sind günstig und deterministisch.
Was geprüft wird
- Token-Obergrenzen für das Denken (konfigurierbar pro Aufwandsstufe)
- Erkennung wiederholter Absätze
- Gleitfenster-basierte N-Gramm-Wiederholung
- Fingerprinting wiederholter Sätze
- Vage Erkennung von Einstiegsmustern (erfasst Schleifen wie „Eigentlich, ich glaube, ich habe es gefunden…“)
- Cut-und-Continue-Wiederherstellungspfad
Wiederherstellungsablauf
Wenn der Guard auslöst, tut er Folgendes:
- Stoppt den Upstream-Stream
- Erfasst das bisher produzierte Denken
- Sendet die Anfrage erneut mit diesem Denken als vorherigem Assistentenkontext
- Deaktiviert das Denken für die Fortsetzung
- Führt die Nutzungsstatistiken von Phase 1 und Phase 2 zusammen
Da das vLLM-Prefix-Caching bereits aktiv ist, ist die Fortsetzung praktisch nahtlos. Phase 2 startet normalerweise mit ~50–100ms TTFT, sodass der Client sieht, wie das Denken direkt in die endgültige Antwort übergeht, anstatt zu hängen.
Beobachtbarkeit
Der Proxy protokolliert jede Auslösung mit:
- Ob der Guard ausgelöst hat
- Auslösegrund
- Verwendete Token-Obergrenze
- Anzahl der Denk-Token
- Zusammengeführte Gesamtnutzung
- Stream-Ende-Metadaten
Ergebnis
Vorher: gelegentlich 2000+ Token-Denkblöcke, die zu nichts führten. Nachher: Das Modell denkt immer noch, wenn es nützlich ist, aber ausuferndes Denken wird abgeschnitten und in eine Antwort umgeleitet. Der Autor beschreibt es als „Proxy-Level-Sicherheitsgurt für lokale LLM-Inferenz“.
Keine Modell-Chirurgie, keine zusätzlichen LLM-Aufrufe – nur Stream-Interception, Token-Zählung, Schleifenerkennung und ein sauberer Wiederherstellungspfad. Der Guard wurde Ende-zu-Ende durch den Live-Proxy gegen echte Trace-Logs validiert.
📖 Vollständige Quelle lesen: r/LocalLLaMA
👀 Siehe auch

TailClaude: Open-Source-Weboberfläche für den Zugriff auf Claude-Code-Sitzungen von Mobilgeräten und Browsern
TailClaude ist eine Open-Source-Weboberfläche, mit der Sie Claude-Code-Sitzungen von Ihrem Smartphone oder jedem Browser in weniger als einer Minute über Tailscale aufrufen und fortsetzen können. Das Projekt wurde mit Unterstützung von Claude Code für das Grundgerüst, das SSE-Streaming-Backend, die mobile Chat-Oberfläche und die QR-Code-Integration entwickelt.

Slack-Plugin für Claude Code: Verbinden Sie sich mit Slack für Kontext und Updates
Slack hat ein neues Plugin für Claude Code veröffentlicht, das eine Verbindung zu Slack für Suche, Nachrichten und Dokumentenerstellung ermöglicht. Das Plugin erlaubt es Claude Code, auf Slack-Kontext zuzugreifen, um technische Probleme zu lösen und Updates zu posten.

Observer: Offline-Agenten für Monitoring und Logging – Nutzen Sie lokale LLMs auf Ihrem Telefon
Observer ist eine Open-Source-iOS-App, die multimodale LLMs lokal auf dem Telefon ausführt, um Ereignisse zu überwachen, Daten zu protokollieren und Discord-Benachrichtigungen auszulösen – alles offline und kostenlos.

Phaselock: Ein KI-Agenten-Steuerungssystem inspiriert von Erziehungstechniken
Phaselock ist eine Open-Source-Agent-Skill, die vier Kontrollmechanismen für KI-Agenten implementiert: explizite Gates vor Aktionen, sofortiges Feedback bei Fehlern, eingeschränkte Auswahlmöglichkeiten und mechanische Regelbefolgung. Es funktioniert mit Claude Code, Cursor, Windsurf und Tools, die Hooks unterstützen.