LLM은 명시적 지시에도 불구하고 구조화된 출력에 추론 과정을 노출시킵니다

✍️ OpenClawRadar📅 게시일: April 14, 2026🔗 Source
LLM은 명시적 지시에도 불구하고 구조화된 출력에 추론 과정을 노출시킵니다
Ad

문제: LLM 검증 과정에서 추론 내용이 유출됨

Claude에 대한 병렬 API 호출을 수행하고 각 호출의 구조화된 출력을 파싱하는 도구를 개발하는 개발자가 간헐적인 문제를 발견했습니다. 각 호출은 [COVER], [SLIDE 1], [CAPTION] 등과 같은 특정 마커 안에 내용을 반환합니다. 두 번째 LLM 패스는 출력을 규칙에 대해 검증하고 실패한 부분을 재작성합니다.

검증 프롬프트는 명시적으로 다음과 같이 명시합니다: "정확히 동일한 형식으로 수정된 텍스트만 반환하세요. 설명 없음. 추론 없음. 위반 목록 없음."

그럼에도 불구하고, 검증 모델은 가끔 수정된 내용 앞에 추론을 출력합니다. 예를 들어: "이 텍스트의 위반 사항을 확인해야 합니다... 이 문장들은 순전히 효과를 위해 사용된 연속적인 극적 쌍을 형성합니다. 다음은 재작성된 내용입니다:" 뒤에 실제 수정된 텍스트가 옵니다.

하류 영향

이 추론 텍스트는 파서로 바로 전달됩니다. 파서는 [COVER]에서 시작하는 내용을 기대하지만 메타 설명을 받게 됩니다. 이로 인해 하류에서 필드 정렬이 잘못됩니다. 한 경우에는 검증기의 추론 텍스트가 이미지 프롬프트 필드 안에 들어가게 되었는데, 파서가 추론을 본문 내용으로 인식하여 모든 것을 몇 줄 아래로 이동시켰기 때문입니다.

프롬프트 강화만으로는 문제를 해결하지 못했습니다. 지시를 더 명확하게 만들고, "출력은 반드시 첫 번째 내용 마커로 시작해야 합니다"를 추가하고, "절대 추론을 포함하지 마세요"를 추가하는 것은 빈도를 줄였지만 완전히 제거하지는 못했습니다. 모델은 특히 수정할 위반 사항을 발견할 때 지시를 무시하는 경우가 있습니다—자신의 작업 과정을 보여주고 싶어 합니다.

Ad

해결책: 이중 방어층

효과가 있었던 해결책은 두 가지 층을 포함했습니다:

  • 1층: 프롬프트 강화. 문제 발생 빈도를 줄이기 때문에 여전히 가치가 있습니다.
  • 2층: 모든 파싱이 발생하기 전에 모든 검증 출력에서 실행되는 방어적 제거 함수입니다. 구조화된 형식의 경우, 첫 번째 인식된 마커에 고정하여 그 앞의 모든 것을 버립니다. 일반 텍스트 형식의 경우, 알려진 검증기 설명 패턴(예: "이 텍스트를 확인해 보겠습니다" 또는 "이것은 제약 조건을 위반합니다")과 일치하는 줄을 제거합니다.

파싱 전 제거 순서가 핵심입니다. 모든 하류 파서는 이미 정제된 출력에서 작동합니다. 이는 필드별 제거 로직을 유지하거나 새로운 추론 형식과의 끊임없는 싸움을 피할 수 있게 합니다.

구현 고려사항

일반 텍스트 제거 패턴의 경우, 신중한 설계가 필요합니다. "This is a violation"을 포착하는 정규식은 합법적인 내용의 "This is a common mistake"도 포착할 수 있습니다. 패턴은 "This violates the/a rule/constraint"와 같이 검증기 특정 언어만 일치하도록 강화되어야 하며, "This is"나 "This uses"와 같은 광범위한 일치는 피해야 합니다. 각 패턴은 배포 전 실제 내용에 대해 검토가 필요합니다.

LLM에서 구조화된 출력을 파싱하는 경우, 프롬프트 지시를 최선의 노력의 첫 번째 패스로 취급하고 항상 파서 앞에 코드 수준의 방어 장치를 두세요. 모델은 95%의 시간 동안 준수하지만, 준수하지 않는 5%의 경우 간헐적이기 때문에 재현하기 어려운 방식으로 하류 로직을 중단시킬 것입니다.

📖 전체 출처 읽기: r/ClaudeAI

Ad

👀 See Also

🦀
Tools

Netlify 테스트: 코딩용 AI 모델 11개 중 최고는?

Netlify가 11개 AI 모델에 동일한 코딩 프롬프트를 실행한 결과, 결과물 품질과 크레딧 비용에서 큰 차이를 보였습니다. 다음 코딩 에이전트를 선택하기 전에 확인해 보세요.

OpenClawRadar
로컬 AI 에이전트, 오픈소스 서버로 STT 및 TTS 지연 시간 1초 미만 달성
Tools

로컬 AI 에이전트, 오픈소스 서버로 STT 및 TTS 지연 시간 1초 미만 달성

개발자가 하이브리드 스레드 관리 GPU 아키텍처를 사용한 Whisper large-v3-turbo로 ~0.2초 STT 지연 시간을 달성하고, 저지연 합성을 위해 최적화된 Coqui-TTS로 ~250ms TTS 지연 시간을 달성했습니다. 두 구현 모두 완전히 자체 호스팅되며 오픈소스로 공개되었습니다.

OpenClawRadar
LM Studio 파서 버그로 인해 Qwen3.5 도구 호출 및 추론 기능이 중단됩니다
Tools

LM Studio 파서 버그로 인해 Qwen3.5 도구 호출 및 추론 기능이 중단됩니다

LM Studio의 서버 파서에는 도구 호출을 자동으로 중단시키고, 추론 출력을 손상시키며, 모델을 실제보다 더 나쁘게 보이게 만드는 세 가지 상호작용하는 버그가 있습니다. 이러한 문제는 Qwen3.5 및 DeepSeek-R1과 같은 추론 모델에 영향을 미치며, 1년 이상 전에 보고된 버그 하나는 아직 해결되지 않았습니다.

OpenClawRadar
Qwen3.5-9B-Claude-4.6-Opus-Uncensored-v2 모델이 LM Studio 구성과 함께 출시되었습니다
Tools

Qwen3.5-9B-Claude-4.6-Opus-Uncensored-v2 모델이 LM Studio 구성과 함께 출시되었습니다

Qwen3.5-9B 아키텍처와 Claude 4.6 Opus 학습 데이터를 결합한 검열되지 않은 통합 모델이 이제 사용 가능합니다. 최적의 성능을 위한 LM Studio 0.4.7 설정(온도 0.7, 상위 K 샘플링 20 포함)이 제공됩니다.

OpenClawRadar