Hollow AgentOS, JSON-네이티브 OS 접근 방식으로 Claude 코드 토큰 사용량 68.5% 절감

이것이 무엇인가
Hollow AgentOS는 AI 에이전트를 위해 특별히 설계된 JSON 네이티브 운영 체제 추상화 계층입니다. 이는 인간을 위해 구축된 인프라에서 에이전트를 실행할 때 발생하는 비효율성을 해결합니다. 해당 인프라에서는 모든 상태 확인이 일반적으로 9개의 셸 명령어를 실행하고, 콜드 스타트 시 처음부터 컨텍스트를 재발견해야 합니다.
주요 세부 사항
이 프로젝트는 다섯 가지 실제 시나리오에서 측정 가능한 토큰 감소를 제공합니다:
- 의미론적 검색 vs grep + cat: 토큰 91% 감소
- 에이전트 픽업 vs 콜드 로그 파싱: 토큰 83% 감소
- 상태 폴링 vs 셸 명령어: 토큰 57% 감소
- 전체 감소율: 68.5%
벤치마크는 python3 tools/bench_compare.py를 사용하여 완전히 재현 가능합니다.
기술적 구현
Hollow AgentOS는 MCP(Model Context Protocol)를 통해 Claude Code에 연결되고 Ollama를 통해 로컬 추론을 실행합니다. 이 프로젝트는 MIT 라이선스로 GitHub에서 이용 가능합니다.
아키텍처에 대한 중요한 설명: 이것은 커널 대체품이 아닙니다. 저자는 이를 Android가 Linux 위에 있는 방식과 비교합니다. Android 개발자는 커널 코드를 작성하지 않고 Android 계층과만 상호작용합니다. Hollow는 에이전트와 기저 시스템 사이의 완전한 추상화 계층이 되는 것을 목표로 하므로, 에이전트는 기저 OS를 직접 건드릴 필요가 없어야 합니다.
현재 출시된 것은 "그 비전의 기초이며 완성된 것이 아니다"라고 설명되지만, 이 단계에서도 "정밀도의 눈에 띄는 손실 없이 큰 토큰 감소와 측정 가능한 속도 향상"을 제공합니다.
누구를 위한 것인가
Claude Code로 에이전트 워크플로우를 실행하며 토큰 사용량과 성능을 최적화하고 싶은 개발자들을 위한 것입니다.
📖 전체 원문 읽기: r/ClaudeAI
👀 See Also

피아스트 게이트: LLM 데이터 익명화를 위한 오픈소스 API 프록시
Piast Gate는 민감한 데이터를 LLM에 전송하기 전 익명화하고 응답에서 원본 데이터를 복원하는 오픈소스 API 프록시입니다. 현재 MVP는 Google Gemini API, 폴란드어, 로컬 실행을 지원하며, LLM 처리 없이 텍스트나 Word 문서를 익명화할 수 있습니다.

NLA가 Gemma 3의 내부 활성화를 모든 토큰에 대해 읽을 수 있는 텍스트로 변환
Anthropic이 모델의 내부 상태를 텍스트로 디코딩하는 NLA(Natural Language Autoencoders)를 발표했습니다. Gemma 3와 함께, Auto Verbalizer는 생성된 모든 토큰에 대해 모델이 "생각"한 내용을 설명합니다. 가중치는 Hugging Face에, 데모는 Neuronpedia에 있습니다.

ReRouted: macOS 메뉴 바 앱으로 Claude, Codex, Grok 등 간 자동 폴백
ReRouted는 여러 AI 코딩 도구 계정과 제공자를 위한 로컬 게이트웨이 역할을 하는 가벼운 macOS 메뉴바 앱입니다. 모든 도구를 하나의 로컬 엔드포인트로 연결하면, 제공자 제한에 도달했을 때 자동으로 라우팅과 폴백을 처리합니다.

Skillware는 로컬 모델 파인튜닝을 위해 엔트로피 점수를 포함한 합성 데이터 생성기를 추가합니다.
Skillware가 모델 붕괴를 방지하는 데 도움이 되는 zlib 압축률 휴리스틱을 사용하여 출력 다양성을 점수화하는 새로운 합성 데이터 생성기 스킬을 출시했습니다. 이 도구는 Ollama와 즉시 사용 가능하며, 고수준 추론 배치를 위해 Gemini/Anthropic을 지원하고, .jsonl 파인튜닝 파이프라인을 위한 JSON 배치를 출력합니다.