로컬 LLM 추론을 위한 프록시 수준 루프 탐지

아키텍처
클라이언트 → 프록시 → vLLM → 모델
프록시는 vLLM을 나가는 스트리밍 응답을 가로챕니다. 모델 가중치를 수정하지 않고, 두 번째 LLM을 호출하지 않으며, 임베딩이나 의미 분석을 사용하지 않습니다. 모든 검사는 저렴하고 결정론적입니다.
검사 항목
- 추론 토큰 상한 (노력 수준별로 설정 가능)
- 반복된 문단 감지
- 슬라이딩 윈도우 n-gram 반복
- 반복된 문장 지문 인식
- 퍼지 시작 패턴 감지 ("사실, 찾은 것 같아…"와 같은 루프 포착)
- 잘라서 계속하기 복구 경로
복구 흐름
가드가 작동하면:
- 업스트림 스트림 중지
- 지금까지 생성된 추론 캡처
- 해당 추론을 이전 어시스턴트 컨텍스트로 포함시켜 요청 재전송
- 연속 추론에 대해 생각 비활성화
- 1단계와 2단계 사용 통계 병합
vLLM 프리픽스 캐싱이 이미 활성화되어 있으므로 연속은 사실상 매끄럽습니다. 2단계는 일반적으로 TTFT 50~100ms로 재개되므로 클라이언트는 중단 없이 추론이 최종 답변으로 직접 흐르는 것을 확인합니다.
관찰 가능성
프록시는 각 트리거에 대해 다음을 기록합니다:
- 가드가 작동했는지 여부
- 트리거 이유
- 사용된 토큰 상한
- 추론 토큰 수
- 병합된 총 사용량
- 스트림 종료 메타데이터
결과
이전: 때때로 2000개 이상의 추론 토큰 블록이 아무런 결과 없이 소모됨. 이후: 모델은 여전히 유용할 때 추론하지만, 폭주하는 생각은 잘려서 답변으로 리디렉션됩니다. 저자는 이를 "로컬 LLM 추론을 위한 프록시 수준 안전벨트"라고 설명합니다.
모델 수술도, 추가 LLM 호출도 없이 오직 스트림 가로채기, 토큰 계산, 루프 감지, 깔끔한 복구 경로만 사용합니다. 이 가드는 실제 프록시를 통해 종단 간 검증되었으며 실제 추적 로그를 기반으로 확인되었습니다.
📖 전체 소스 읽기: r/LocalLLaMA
👀 See Also

캐노피: 다중 클로드 코드 에이전트 관리를 위한 터미널 대시보드
Canopy는 git worktree에서 실행되는 여러 AI 코딩 에이전트를 추적하기 위한 단일 대시보드 뷰를 제공하는 오픈 소스 터미널 UI입니다. 에이전트 상태(실행 중, 대기 중, 입력 대기 중, 완료, 오류 발생)를 표시하고, 세션으로 바로 이동하거나 완전히 전환하지 않고 입력을 보낼 수 있습니다.

Gemma4 26B-A4B는 웹 검색 및 이미지 지원으로 빠른 로컬 성능을 제공합니다.
gemma-4-26B-A4B 모델은 RTX 4090에서 초당 약 145 토큰의 성능을 달성하며, 채팅 애플리케이션을 위한 웹 검색 MCP 및 이미지 지원을 포함합니다. 블로그 포스트에서는 Mac과 iPhone에서의 설정 및 크로스 플랫폼 사용법을 상세히 설명합니다.

클로메이트: 팀을 위한 오픈클로
새로운 프로젝트가 다중 사용자 OpenClaw 배포를 통해 공유 지식, 비용 가시성 및 관리자 제어 기능을 제공합니다.

Cowork vs. Claude Chat: 문서 추출 정확도 비교
한 개발자가 140페이지 이상의 금융 PDF에서 데이터를 추출하기 위해 동일한 프롬프트를 사용해 Claude.ai 채팅과 Cowork을 테스트했습니다. 채팅은 150개 이상의 데이터 포인트에서 자체 수정과 오류 없이 기관급 결과를 산출한 반면, Cowork은 조정 항목을 조작하고 단위 수를 반대로 계산하며 전년도 열이 오염되었습니다.