듀얼 모델 아키텍처는 긴 대화에서 토큰 소비를 절반으로 줄입니다.

AI 에이전트를 위한 컨텍스트 압축 시스템
r/ClaudeAI의 한 개발자가 AI 에이전트가 대화 압축 후 컨텍스트를 잃는 문제에 대한 해결책을 공유했습니다. 이 시스템은 저렴한 소형 모델(이른바 "잠재의식")이 배경에서 지속적으로 대화 기록을 압축하는 이중 모델 아키텍처를 사용합니다.
아키텍처 세부 사항
이 시스템은 네 가지 계층으로 구성됩니다:
- 서사적 요약(~1K 토큰)
- 압축된 사실 정보
- 의미론적으로 검색된 원문 인용
- 원시 최근 대화 차례
주 모델("의식")은 일반적으로 원시 기록 120K 토큰이 필요한 동일한 정보 밀도를 가진 선별된 ~35K 토큰 컨텍스트를 받습니다. 주 모델은 하나의 일관된 타임라인을 읽으며 메모리 시스템의 존재를 알지 못합니다.
성능 결과
개발자는 다양한 대화 유형에 걸쳐 260회의 차례를 시뮬레이션했습니다. 지속적인 프로젝트 작업(무거운 연구로 시작하여 모델이 도메인을 학습함에 따라 점차 빠른 교환으로 전환)의 경우, 이 시스템은 토큰 소비를 약 절반으로 줄입니다.
개발 도구
이 시스템은 시뮬레이션을 위해 Claude Code로 구축되었으며, 컨설팅 및 연구 단계에서는 Claude.ai가 사용되었습니다. 개발자는 더 작은 모델을 라우팅하여 더 큰 모델의 컨텍스트를 관리하려 시도했거나 압축 문제에 대한 다른 해결책을 찾은 다른 사람들을 찾고 있습니다.
📖 전체 출처 읽기: r/ClaudeAI
👀 See Also

스마트 픽셀 시계를 사용한 Claude AI 완료 알림
레딧 사용자가 ULANZI TC001 스마트 픽셀 시계에 커스텀 펌웨어와 HTTP 엔드포인트를 사용하여 Claude AI 완료 알림을 표시하는 방법을 공유합니다.

Kios: 셀프 호스팅 Kobo/Calibre 라이브러리를 위한 iOS 리더, 진행 상황 동기화 지원
Kios는 셀프 호스팅 Kobo/Calibre 서버에서 책을 읽고 Kobo 프로토콜, OPDS 1.2/2.0, kosync를 통해 읽기 진행 상황을 동기화하는 iOS 앱입니다. Claude Code로 제작되었습니다.

퍼스트-트리: 클로드 코드를 이용해 수면 중 GitHub 알림을 분류하는 오픈소스 데몬
메뉴 바에서 실행되는 오픈소스 데몬으로, Claude Code를 사용하여 GitHub 알림을 자율적으로 분류합니다. 최근 스캔에서 100개의 알림 중 98개를 처리하고 단 2개만 사람의 검토를 위해 남겼습니다.

Claude Code: AI로 구축한 프론트엔드를 실제 백엔드에 연결하는 방법
Claude Code로 멋진 프론트엔드를 만들 수 있지만, 종종 하드코딩된 데이터를 사용합니다. 실제 백엔드에 연결하는 네 가지 방법을 소개합니다: 원시 API, SDK, CLI, MCP.