에이전트 프레임워크는 세션당 35만 개 이상의 토큰을 정적 파일 재전송에 낭비합니다.

토큰 낭비 벤치마크 결과
로컬 Qwen 3.5 122B 설정에서 수행한 측정 결과, 에이전트 프레임워크가 정적 파일을 반복적으로 재전송함으로써 세션당 350,000개 이상의 토큰을 낭비하는 것으로 나타났습니다. 출처에서는 이 수치를 "비현실적"이라고 설명합니다.
최적화 접근법
컴파일 타임 접근법을 통해 쿼리 컨텍스트를 1,373개 토큰에서 단 73개 토큰으로 줄일 수 있는 방법이 발견되었습니다. 이는 해당 컨텍스트에서 토큰 사용량을 95% 감소시킨 것을 의미합니다.
벤치마크에서는 또한 단순한 JSON 변환이 문제를 30% 더 악화시켜, 토큰 낭비가 기준 측정치를 초과하여 증가한다는 사실도 발견되었습니다.
기술적 배경
에이전트 프레임워크는 일반적으로 시스템 프롬프트, 도구 정의 및 세션 내 여러 상호작용에서 정적으로 유지되는 기타 구성 데이터를 포함합니다. 이 데이터가 모든 쿼리마다 재전송되면 모델에 새로운 정보를 제공하지 않으면서 토큰을 소비하게 됩니다. 이는 Qwen 3.5 122B와 같은 대형 모델에서 특히 비용이 많이 드는데, 토큰 처리가 성능과 비용에 직접적인 영향을 미치기 때문입니다.
컴파일 타임 접근법은 정적 요소를 재전송하는 대신 참조할 수 있도록 사전 처리하는 것을 포함할 가능성이 높으며, 이는 현대 웹 애플리케이션이 정적 자산을 캐시하는 방식과 유사합니다. AI 코딩 에이전트를 사용하는 개발자들에게 이 오버헤드를 줄이는 것은 응답 시간을 크게 개선하고 운영 비용을 절감할 수 있습니다.
📖 Read the full source: r/LocalLLaMA
👀 See Also

개발자가 Claude Code를 사용하여 17가지 생물학적 원칙을 적용한 AI 프레임워크를 구축합니다
한 개발자가 1999년 출간된 '천재의 불꽃'이라는 책을 바탕으로 역치 발화와 헤비안 가소성 등 17가지 생물학적 원리를 구현하여 'Cognitive Sparks'라는 AI 프레임워크를 만들었습니다. 22개의 설계 문서와 3,300줄의 코드로 구성된 이 전체 프로젝트는 Claude Code를 사용해 하루 만에 구축되었으며, 인간이 직접 작성한 코드는 전혀 없습니다.

클로드 코드 루틴: AI 개발 워크플로우를 위한 자동화된 클라우드 작업
Claude Code 루틴은 개발자가 Claude Code 구성을 Anthropic이 관리하는 클라우드 인프라에서 실행되는 자동화된 작업으로 저장할 수 있게 합니다. 루틴은 저장소에 대한 프롬프트의 무인 실행을 위해 예약, API, GitHub 트리거를 지원합니다.

YantrikClaw 포크는 ZeroClaw에 인지적 메모리, 컴패니언 모드 및 계층 인식 도구를 추가합니다.
YantrikClaw는 ZeroClaw의 포크로, 세 가지 주요 기능을 도입합니다: 지속적인 의미 기억을 위한 YantrikDB를 활용한 인지 메모리, 유대감 추적과 적극적 행동을 지원하는 컴패니언 모드, 그리고 라즈베리 파이부터 대규모 클러스터까지 모델 크기에 맞춰 조정되는 계층 인식 도구 선택 기능입니다.

엔그램: 현저성 게이트 캡처와 드림 사이클을 갖춘 Claude 메모리 플러그인
엔그램은 캡처 시점에 5가지 중요도 차원을 사용해 관찰을 필터링하는 Claude 메모리 플러그인으로, 점수 평가에 LLM 호출 없이 높은 점수를 받은 이벤트만 SQLite에 저장합니다. 5가지 훅을 통한 자동 주입 기능과 세션 종료 시 반복되는 워크플로를 추출하는 드림 사이클을 특징으로 합니다.