코드북 무손실 LLM 압축: 비트 단위 패킹으로 10-25% RAM 감소 달성

✍️ OpenClawRadar📅 게시일: March 15, 2026🔗 Source
코드북 무손실 LLM 압축: 비트 단위 패킹으로 10-25% RAM 감소 달성
Ad

개발자가 무손실 LLM 압축을 위한 개념 증명 코드를 공개했습니다. 이 코드는 인덱싱된 가중치의 비트 단위 일반 패킹을 통해 메모리 사용량을 10-25% 줄입니다. 이 기술은 더 작은 모델 크기를 위해 일부 추론 속도를 희생하여, 제한된 VRAM을 가진 하드웨어에서 더 큰 모델을 실행할 수 있게 합니다.

작동 원리

개발자는 먼저 LLM 레이어에 실제로 존재하는 고유 값이 얼마나 되는지 질문으로 시작했습니다. 분석 결과, fp16이 16비트를 사용하지만 대부분의 모델은 약 12-13비트의 고유 값만 활용한다는 것이 밝혀졌습니다. 이러한 값을 블록으로 패킹함으로써, 이 기술은 정밀도를 잃지 않고 압축을 달성합니다.

성능 특성

  • RAM 감소: 테스트된 모델에서 10-25%+
  • 속도 영향: 예시 테스트에서 추론 속도가 약 절반으로 감소
  • 테스트 하드웨어: NVIDIA P2200(5GB) 및 CPU, AMD MI50(32GB)용 업데이트 개발 중

구현 세부 사항

개발자는 Claude, Qwen, Gemini를 포함한 AI 코딩 어시스턴트를 사용하여 몇 주 동안 이 프로젝트에 작업했습니다. 저장소에는 무손실 버전과 손실/균형 버전이 모두 포함되어 있지만, 손실 버전은 아직 광범위하게 테스트되지 않았습니다.

개발자는 이 압축 접근법이 모델의 "압축성"—매개변수 공간을 얼마나 효율적으로 사용하는지—를 측정하는 방법으로 활용될 수 있다고 제안합니다.

코드 가용성

개념 증명 코드는 GitHub에서 사용할 수 있습니다: https://github.com/bigattichouse/Codebook-Quantization

📖 Read the full source: r/LocalLLaMA

Ad

👀 See Also

오픈클로 에이전트를 위한 신원 및 평판 레이어
Tools

오픈클로 에이전트를 위한 신원 및 평판 레이어

개발자 팀이 다단계 에이전트 워크플로우에서 발생하는 신원 손실 문제를 해결하기 위해 MCP-I와 IdentiClaw를 구축했으며, 평판 레지스트리로 knowthat.ai를 개발했습니다. 그들은 MCP-I 사양을 탈중앙 신원 재단에 기부했습니다.

OpenClawRadar
클로드의 임포트 기능을 사용하여 AI 에이전트 메모리 내보내기
Tools

클로드의 임포트 기능을 사용하여 AI 에이전트 메모리 내보내기

레딧 사용자가 ChatGPT와 Claude와 같은 AI 에이전트에서 저장된 기억을 추출한 다음 OpenClaw로 가져오는 프롬프트를 공유합니다. 이 프롬프트는 지침, 개인 세부 정보, 프로젝트, 도구 및 선호도를 포함한 모든 저장된 컨텍스트를 요청합니다.

OpenClawRadar
OpenClaw 플러그인은 Engram 서버를 통해 영구 메모리를 추가합니다.
Tools

OpenClaw 플러그인은 Engram 서버를 통해 영구 메모리를 추가합니다.

한 개발자가 OpenClaw 에이전트를 Engram에 연결하는 TypeScript 플러그인을 만들었습니다. Engram은 SQLite와 FTS5 검색을 사용하는 Go 기반의 경량 메모리 서버입니다. 이 플러그인은 에이전트 턴마다 프롬프트에 관련 메모리를 자동으로 주입하는 11개의 도구, 4개의 라이프사이클 훅, 자동 회상 기능을 제공합니다.

OpenClawRadar
Claude Code 세션 대시보드: 다중 세션 모니터링을 위한 오픈소스 도구
Tools

Claude Code 세션 대시보드: 다중 세션 모니터링을 위한 오픈소스 도구

여러 개의 Claude Code 세션을 동시에 모니터링하는 오픈소스 대시보드로, 토큰 사용량, 비용, 세션 상태, 컨텍스트 창 사용량, 활성 서브에이전트를 보여줍니다. 설치에는 세 가지 명령어가 필요합니다: git clone, cd, npm install && npm start.

OpenClawRadar