코드북 무손실 LLM 압축: 비트 단위 패킹으로 10-25% RAM 감소 달성

개발자가 무손실 LLM 압축을 위한 개념 증명 코드를 공개했습니다. 이 코드는 인덱싱된 가중치의 비트 단위 일반 패킹을 통해 메모리 사용량을 10-25% 줄입니다. 이 기술은 더 작은 모델 크기를 위해 일부 추론 속도를 희생하여, 제한된 VRAM을 가진 하드웨어에서 더 큰 모델을 실행할 수 있게 합니다.
작동 원리
개발자는 먼저 LLM 레이어에 실제로 존재하는 고유 값이 얼마나 되는지 질문으로 시작했습니다. 분석 결과, fp16이 16비트를 사용하지만 대부분의 모델은 약 12-13비트의 고유 값만 활용한다는 것이 밝혀졌습니다. 이러한 값을 블록으로 패킹함으로써, 이 기술은 정밀도를 잃지 않고 압축을 달성합니다.
성능 특성
- RAM 감소: 테스트된 모델에서 10-25%+
- 속도 영향: 예시 테스트에서 추론 속도가 약 절반으로 감소
- 테스트 하드웨어: NVIDIA P2200(5GB) 및 CPU, AMD MI50(32GB)용 업데이트 개발 중
구현 세부 사항
개발자는 Claude, Qwen, Gemini를 포함한 AI 코딩 어시스턴트를 사용하여 몇 주 동안 이 프로젝트에 작업했습니다. 저장소에는 무손실 버전과 손실/균형 버전이 모두 포함되어 있지만, 손실 버전은 아직 광범위하게 테스트되지 않았습니다.
개발자는 이 압축 접근법이 모델의 "압축성"—매개변수 공간을 얼마나 효율적으로 사용하는지—를 측정하는 방법으로 활용될 수 있다고 제안합니다.
코드 가용성
개념 증명 코드는 GitHub에서 사용할 수 있습니다: https://github.com/bigattichouse/Codebook-Quantization
📖 Read the full source: r/LocalLLaMA
👀 See Also

오픈클로 에이전트를 위한 신원 및 평판 레이어
개발자 팀이 다단계 에이전트 워크플로우에서 발생하는 신원 손실 문제를 해결하기 위해 MCP-I와 IdentiClaw를 구축했으며, 평판 레지스트리로 knowthat.ai를 개발했습니다. 그들은 MCP-I 사양을 탈중앙 신원 재단에 기부했습니다.

클로드의 임포트 기능을 사용하여 AI 에이전트 메모리 내보내기
레딧 사용자가 ChatGPT와 Claude와 같은 AI 에이전트에서 저장된 기억을 추출한 다음 OpenClaw로 가져오는 프롬프트를 공유합니다. 이 프롬프트는 지침, 개인 세부 정보, 프로젝트, 도구 및 선호도를 포함한 모든 저장된 컨텍스트를 요청합니다.

OpenClaw 플러그인은 Engram 서버를 통해 영구 메모리를 추가합니다.
한 개발자가 OpenClaw 에이전트를 Engram에 연결하는 TypeScript 플러그인을 만들었습니다. Engram은 SQLite와 FTS5 검색을 사용하는 Go 기반의 경량 메모리 서버입니다. 이 플러그인은 에이전트 턴마다 프롬프트에 관련 메모리를 자동으로 주입하는 11개의 도구, 4개의 라이프사이클 훅, 자동 회상 기능을 제공합니다.

Claude Code 세션 대시보드: 다중 세션 모니터링을 위한 오픈소스 도구
여러 개의 Claude Code 세션을 동시에 모니터링하는 오픈소스 대시보드로, 토큰 사용량, 비용, 세션 상태, 컨텍스트 창 사용량, 활성 서브에이전트를 보여줍니다. 설치에는 세 가지 명령어가 필요합니다: git clone, cd, npm install && npm start.