코드북 무손실 LLM 압축: 비트 단위 패킹으로 10-25% RAM 감소 달성

개발자가 무손실 LLM 압축을 위한 개념 증명 코드를 공개했습니다. 이 코드는 인덱싱된 가중치의 비트 단위 일반 패킹을 통해 메모리 사용량을 10-25% 줄입니다. 이 기술은 더 작은 모델 크기를 위해 일부 추론 속도를 희생하여, 제한된 VRAM을 가진 하드웨어에서 더 큰 모델을 실행할 수 있게 합니다.
작동 원리
개발자는 먼저 LLM 레이어에 실제로 존재하는 고유 값이 얼마나 되는지 질문으로 시작했습니다. 분석 결과, fp16이 16비트를 사용하지만 대부분의 모델은 약 12-13비트의 고유 값만 활용한다는 것이 밝혀졌습니다. 이러한 값을 블록으로 패킹함으로써, 이 기술은 정밀도를 잃지 않고 압축을 달성합니다.
성능 특성
- RAM 감소: 테스트된 모델에서 10-25%+
- 속도 영향: 예시 테스트에서 추론 속도가 약 절반으로 감소
- 테스트 하드웨어: NVIDIA P2200(5GB) 및 CPU, AMD MI50(32GB)용 업데이트 개발 중
구현 세부 사항
개발자는 Claude, Qwen, Gemini를 포함한 AI 코딩 어시스턴트를 사용하여 몇 주 동안 이 프로젝트에 작업했습니다. 저장소에는 무손실 버전과 손실/균형 버전이 모두 포함되어 있지만, 손실 버전은 아직 광범위하게 테스트되지 않았습니다.
개발자는 이 압축 접근법이 모델의 "압축성"—매개변수 공간을 얼마나 효율적으로 사용하는지—를 측정하는 방법으로 활용될 수 있다고 제안합니다.
코드 가용성
개념 증명 코드는 GitHub에서 사용할 수 있습니다: https://github.com/bigattichouse/Codebook-Quantization
📖 Read the full source: r/LocalLLaMA
👀 See Also

오프 그리드 모바일 앱, 온디바이스 AI 도구 사용 추가 및 3배 속도 향상
오프 그리드 모바일 앱이 이제 AI 모델이 웹 검색, 계산기, 날짜/시간, 디바이스 정보와 같은 도구들을 완전히 오프라인에서 사용할 수 있도록 업데이트되었으며, 구성 가능한 KV 캐시 옵션으로 휴대폰에서 최대 30 토큰/초의 속도를 제공합니다.

단일 호출 MCP 파이프라인이 Claude Code 토큰 사용량을 74% 감소시킵니다
한 개발자가 컨텍스트 엔진(MCP 서버)을 구축한 경험을 공유했습니다. 이 엔진은 Claude Code에 코드베이스의 의존성 그래프를 제공하여 전체 파일 대신 관련 코드만 읽을 수 있게 합니다. 이 도구는 원본 파일 대신 의존성 그래프와 스켈레톤을 제공함으로써 토큰 사용량을 크게 줄입니다.

Sx: AI 스킬, MCP 및 명령어를 위한 오픈소스 패키지 매니저
Sx는 팀이 모든 AI 클라이언트(Claude Code, Cursor, Copilot, Gemini)에서 AI 구성을 공유, 버전 관리 및 범위 지정할 수 있도록 하는 스킬, MCP 설정, 명령, 후크 및 에이전트를 위한 비공개 npm 같은 패키지 관리자입니다.
협업: 다중 에이전트 전환을 통한 구조화된 비동기 문서 작성을 위한 클로드 코드 스킬
'collaborate'라는 클로드 코드 스킬을 사용하면 여러 명이 문서를 공동 작성할 수 있습니다. 각 참가자는 클로드로부터 이전 변경 사항, 추론, 다음 작업에 대한 평이한 영어 브리핑을 받으며, 병렬 섹션, 구조화된 비평, Slack/Signal 알림을 지원합니다.