Рассуждение Охрана: Обнаружение циклов на уровне прокси для локального вывода LLM

✍️ OpenClawRadar📅 Опубликовано: 30 апреля 2026 г.🔗 Source
Рассуждение Охрана: Обнаружение циклов на уровне прокси для локального вывода LLM
Ad

Разработчик, запускающий Qwen3.6 MoE за прокси vLLM, столкнулся с распространенной проблемой надежности: неконтролируемые циклы рассуждения, когда модель повторяется внутри блока рассуждения, сжигая токены и останавливая агентов. При скорости 180+ токенов/сек даже 20–30-секундный цикл тратит время GPU и блокирует запросы клиентов. Они создали легковесный защитник, который живет на уровне прокси и применяет детерминированные проверки к потоковому выводу до того, как он достигнет клиента.

Архитектура

Клиент → Прокси → vLLM → Модель

Прокси перехватывает потоковый ответ на выходе из vLLM. Он не изменяет веса модели, не вызывает вторую LLM и не использует эмбеддинги или семантический анализ. Все проверки дешевы и детерминированы.

Что проверяется

  • Ограничения токенов рассуждения (настраиваются для каждого уровня усилий)
  • Обнаружение повторяющихся абзацев
  • Повторение n-грамм с скользящим окном
  • Снятие отпечатков повторяющихся предложений
  • Нечеткое обнаружение открывающих паттернов (ловит циклы вроде "На самом деле, кажется, я нашел...")
  • Путь восстановления "прервать и продолжить"
Ad

Процесс восстановления

Когда защитник срабатывает, он:

  • Останавливает восходящий поток
  • Захватывает рассуждение, произведенное на данный момент
  • Повторно отправляет запрос с этим рассуждением, встроенным как предыдущий контекст ассистента
  • Отключает мышление для продолжения
  • Объединяет статистику использования фазы 1 и фазы 2

Поскольку кэширование префиксов vLLM уже активно, продолжение происходит практически бесшовно. Фаза 2 обычно возобновляется с TTFT около 50–100 мс, так что клиент видит, как рассуждение плавно переходит в финальный ответ, а не зависает.

Наблюдаемость

Прокси логирует каждое срабатывание с:

  • Сработал ли защитник
  • Причина срабатывания
  • Использованный лимит токенов
  • Количество токенов рассуждения
  • Объединенное общее использование
  • Метаданные конца потока

Результат

До: иногда блоки рассуждений на 2000+ токенов, которые никуда не вели. После: модель все еще рассуждает, когда это полезно, но неконтролируемое мышление прерывается и перенаправляется в ответ. Автор описывает это как "ремень безопасности на уровне прокси для локального вывода LLM".

Никаких хирургических вмешательств в модель, никаких дополнительных вызовов LLM — только перехват потока, подсчет токенов, обнаружение циклов и чистый путь восстановления. Защитник проверен от начала до конца через живой прокси на реальных логах трассировки.

📖 Читать полный источник: r/LocalLLaMA

Ad

👀 Смотрите также

Claude Code создает платформу AI-агентов для рекламных щитов — агенты становятся вирусными с манифестом
Инструменты

Claude Code создает платформу AI-агентов для рекламных щитов — агенты становятся вирусными с манифестом

Разработчик использовал Claude Code для создания agentbillboard.space — платформы, где ИИ-агенты получают собственный поддомен, публикуют HTML и должны отправлять сигнал жизнедеятельности каждые 5 часов. Один агент (LEGION) без запроса написал манифест.

OpenClawRadar
Плагин Claude Code с открытым исходным кодом захватывает книги и преобразует их в структурированный Markdown.
Инструменты

Плагин Claude Code с открытым исходным кодом захватывает книги и преобразует их в структурированный Markdown.

Разработчик опубликовал в открытом доступе плагин Claude Code, который автоматически делает скриншоты страниц книг, выполняет OCR с помощью macOS Vision и создает структурированные Markdown-файлы, организованные по темам, а не по порядку глав. Инструмент поддерживает Kindle, Apple Books, Kindle Cloud Reader и отсканированные PDF-файлы на macOS.

OpenClawRadar
Искусственная жизнь: 300-строчная реализация на Python исследований в области вычислительной жизни
Инструменты

Искусственная жизнь: 300-строчная реализация на Python исследований в области вычислительной жизни

Реализация на Python, воспроизводящая статью Computational Life, в которой сетка 240x135 из программ, подобных Brainfuck, взаимодействует и эволюционирует в самовоспроизводящийся код через случайное спаривание и конкатенацию лент инструкций.

OpenClawRadar
Открытый SDK для AI-работы с знаниями
Инструменты

Открытый SDK для AI-работы с знаниями

ClioAI выпустил <strong>kw-sdk</strong>, открытый набор инструментов для разработки программного обеспечения, предназначенный для структурирования работы ИИ-агентов в областях знаний, таких как исследование, анализ, стратегия и написание текстов. В отличие от традиционных кодовых фреймворков, которые имеют естественные сигналы верификации через тестирование, работа с знаниями требует структурированных подходов для проверки и оценки задач.

OpenClawRadar