WCY 형식은 LLM 토큰 오버헤드를 50-71% 감소시키고 구조적인 '모름' 표시자를 추가합니다.

WCY(Watch → Compute → Yield)는 LLM 토큰 오버헤드를 줄이고 추론 과정에서의 불확실성을 위한 구조적 마커를 제공하기 위해 설계된 라인 지향 형식입니다. JSON의 괄호, 따옴표, 쉼표를 한 줄에 하나의 마커를 사용하는 구문으로 대체합니다.
토큰 감소 벤치마크
10-500행 및 MCP 교환 유형에 대한 테스트 결과:
- 구조화된 데이터 대 JSON: -50 ~ -54% 토큰 감소
- 툴-콜 스키마: -65 ~ -71% 감소
- 전체 MCP 프로토콜 교환: -61% 감소
- 다중 에이전트 출력 토큰: -40% 감소
파인튜닝이 필요 없습니다—모델이 형식을 전환하기 위해 세 번의 퓨샷 예시만으로 충분합니다. 이 접근 방식으로 복잡한 작업에서 parse_r 메트릭이 0.29에서 1.00으로 향상됩니다.
불확실성을 위한 ? 마커
WCY는 LLM이 추론 중 모르는 부분을 표시할 수 있는 구조적 방법을 도입합니다. ? (void-B) 슬롯은 모델이 인라인으로 불확실성을 나타낼 수 있게 합니다:
: ?diagnosis hint=labs+imaging conf_range=0.4..0.8
order CT_scan reason=from=3 . CT_result mass_in_RUL size=2.3cm : diagnosis=adenocarcinoma conf=0.82 from=3,5테스트 결과:
- 제로샷: 프롬프트에 사양이 포함되어 있어도 모델이 ? 마커를 0% 사용
- 3개 예시 사용 시: 추적당 5.4개 마커, 67-97% 해결
- 8개 도메인에 걸친 48개 파이프라인 추적: 95% 해결률, 100% 품질 게이트 통과
from= 슬롯은 어떤 관찰이 어떤 결론을 지원하는지 인라인으로 추적하여 환각 체인을 포착하는 데 도움이 됩니다.
사용 가능한 리소스
- wcy_parser.py — 순수 파이썬, 외부 종속성 없음
- wcy_eval.py — 3축 점수화(구조적/의미/출처)
- void-B 주기가 포함된 60개 추론 추적(CC BY 4.0 라이선스, 파인튜닝 실험용)
- 더 많은 추적을 생성하는 파이프라인 스크립트
지금까지 Claude Sonnet에서만 테스트되었습니다. 저자는 동일한 퓨샷 예시로 Qwen, Llama, Mistral에서도 0% → 5.4 마커 결과가 유지되는지 궁금해합니다.
📖 Read the full source: r/LocalLLaMA
👀 See Also

alogin: 인간-참여형 AI 에이전트를 위한 Go 기반 보안 게이트웨이
alogin은 Go 기반의 오픈소스 보안 게이트웨이로, AI 에이전트와 인프라 간의 안전한 통로를 제공합니다. Claude Desktop을 위한 내장 MCP 서버 지원, 인간 개입 안전 장치, 암호화된 자격 증명 저장소 등의 기능을 갖추고 있습니다.

인지과학 기법으로 LLM 창의성 강화: Claude 코드용 /reframe 슬래시 명령어
레딧 사용자가 Claude Code용 /reframe 슬래시 명령어를 개발했는데, 이 명령어는 거리-참여 진동이라는 인지과학 기법을 구현하여 세 가지 오픈 웨이트 LLM에서 테스트한 결과 창의적 문제 해결 능력을 40% 향상시켰습니다.

오픈소스 MCP 서버는 Claude Code와 IDE 도구를 연결합니다
오픈소스 MCP 서버는 Claude Code가 LSP, 터미널, Git, GitHub, 디버깅, 진단 도구 등 124개 이상의 도구를 통해 IDE 기능에 지속적으로 접근할 수 있게 합니다. 이 서버를 설정한 기기가 있으면 모바일 기기에서도 코딩이 가능해집니다.

새로운 구조화된 데이터 API가 LLM 에이전트에 대한 구독 가격 정책을 제공합니다
한 개발자가 스트리밍 플랫폼, 차량 공유 서비스, 데이트 앱 및 기타 구독 기반 플랫폼 간의 구독 가격을 정규화하는 구조화된 데이터 API를 공개했습니다. 이 API는 일관된 JSON 스키마, 가능한 경우 지역 인식 가격, 그리고 LLM 에이전트가 스크래핑 없이 소비할 수 있는 MCP 호환 엔드포인트를 제공합니다.