Codebook Lossless LLM Compression: Redução de 10-25% na RAM com Empacotamento Bitwise

✍️ OpenClawRadar📅 Publicado: March 15, 2026🔗 Source
Codebook Lossless LLM Compression: Redução de 10-25% na RAM com Empacotamento Bitwise
Ad

Um desenvolvedor publicou um código de prova de conceito para compressão sem perdas de LLMs que reduz o uso de memória em 10-25% por meio do empacotamento genérico bit a bit de pesos indexados. A técnica troca um pouco da velocidade de inferência por um tamanho de modelo menor, tornando possível executar modelos maiores em hardware com VRAM limitada.

Como Funciona

O desenvolvedor começou perguntando quantos valores únicos realmente existem nas camadas de LLMs. A análise revelou que, embora o fp16 use 16 bits, a maioria dos modelos utiliza apenas cerca de 12-13 bits de valores únicos. Ao empacotar esses valores em blocos, a técnica alcança compressão sem perder precisão.

Características de Desempenho

  • Redução de RAM: 10-25%+ nos modelos testados
  • Impacto na velocidade: Velocidade de inferência aproximadamente reduzida pela metade nos testes de exemplo
  • Hardware de teste: NVIDIA P2200 (5GB) e CPU, com atualizações sendo desenvolvidas para AMD MI50 (32GB)
Ad

Detalhes de Implementação

O desenvolvedor trabalhou neste projeto por várias semanas usando assistentes de codificação com IA, incluindo Claude, Qwen e Gemini. O repositório inclui versões sem perdas e com perdas/equilibradas, embora a versão com perdas ainda não tenha sido extensivamente testada.

O desenvolvedor sugere que esta abordagem de compressão pode servir como uma forma de medir a "compactidade" de um modelo - quão eficientemente ele usa seu espaço de parâmetros.

Disponibilidade do Código

O código de prova de conceito está disponível no GitHub: https://github.com/bigattichouse/Codebook-Quantization

📖 Read the full source: r/LocalLLaMA

Ad

👀 See Also

KANBAII: Um Quadro Kanban Visual Criado com Claude Code para Desenvolvimento Assistido por IA
Tools

KANBAII: Um Quadro Kanban Visual Criado com Claude Code para Desenvolvimento Assistido por IA

Um desenvolvedor criou o KANBAII, uma ferramenta local de quadro kanban inteiramente com Claude Code ao longo de dois meses. Ele fornece gerenciamento visual de tarefas, planejamento por IA e modos de execução paralela para fluxos de trabalho do Claude Code.

OpenClawRadar
Marky: Um Visualizador Leve de Markdown para Documentação Gerada por Agentes
Tools

Marky: Um Visualizador Leve de Markdown para Documentação Gerada por Agentes

Marky é um visualizador de markdown para desktop desenvolvido com Tauri v2 e React que abre arquivos .md a partir do terminal com recarregamento em tempo real. Ele apresenta uso prioritário pela CLI, realce de sintaxe com Shiki, suporte a matemática KaTeX, diagramas Mermaid e workspaces para pastas.

OpenClawRadar
Repositório Gratuito de Playbook de Lançamento de Produtos de IA para Usuários do Claude
Tools

Repositório Gratuito de Playbook de Lançamento de Produtos de IA para Usuários do Claude

Um desenvolvedor lançou um repositório gratuito contendo um playbook estruturado para lançamento de produtos de IA, projetado para funcionar com o Claude. O repositório organiza a experiência de lançamento em etapas práticas, incluindo estratégia, preparação, execução, e inclui modelos e referências de ferramentas.

OpenClawRadar
Gargalo de Verificação de Código do Claude e Solução de Plugin de Automação de Navegador
Tools

Gargalo de Verificação de Código do Claude e Solução de Plugin de Automação de Navegador

Um desenvolvedor relata que a verificação continua sendo a parte mais lenta do uso do Claude Code, exigindo testes manuais de recursos. Eles encontraram um plugin de automação de navegador que permite ao agente verificar fluxos reais do produto antes de marcar tarefas como concluídas.

OpenClawRadar