Compresión LLM sin Pérdidas con Codebook: Reducción de RAM del 10-25% mediante Empaquetamiento Bit a Bit

✍️ OpenClawRadar📅 Publicado: 15 de marzo de 2026🔗 Source
Compresión LLM sin Pérdidas con Codebook: Reducción de RAM del 10-25% mediante Empaquetamiento Bit a Bit
Ad

Un desarrollador ha publicado código de prueba de concepto para la compresión sin pérdida de LLM que reduce el uso de memoria en un 10-25% mediante el empaquetado genérico bit a bit de pesos indexados. La técnica intercambia algo de velocidad de inferencia por un tamaño de modelo más pequeño, haciendo posible ejecutar modelos más grandes en hardware con VRAM limitada.

Cómo funciona

El desarrollador comenzó preguntándose cuántos valores únicos existen realmente en las capas de LLM. El análisis reveló que, aunque fp16 usa 16 bits, la mayoría de los modelos solo utilizan alrededor de 12-13 bits de valores únicos. Al empaquetar estos valores en bloques, la técnica logra compresión sin perder precisión.

Características de rendimiento

  • Reducción de RAM: 10-25%+ en los modelos probados
  • Impacto en la velocidad: La velocidad de inferencia se reduce aproximadamente a la mitad en las pruebas de ejemplo
  • Hardware de prueba: NVIDIA P2200 (5GB) y CPU, con actualizaciones en desarrollo para AMD MI50 (32GB)
Ad

Detalles de implementación

El desarrollador trabajó en este proyecto durante varias semanas utilizando asistentes de codificación con IA, incluidos Claude, Qwen y Gemini. El repositorio incluye versiones sin pérdida y con pérdida/equilibradas, aunque la versión con pérdida aún no ha sido probada extensamente.

El desarrollador sugiere que este enfoque de compresión podría servir como una forma de medir la "compacidad" de un modelo: qué tan eficientemente utiliza su espacio de parámetros.

Disponibilidad del código

El código de prueba de concepto está disponible en GitHub: https://github.com/bigattichouse/Codebook-Quantization

📖 Read the full source: r/LocalLLaMA

Ad

👀 Ver también

Qwen3.5-35B-A3B-UD-Q6_K_XL Probado en Flujos de Trabajo de Desarrollo de Producción
Herramientas

Qwen3.5-35B-A3B-UD-Q6_K_XL Probado en Flujos de Trabajo de Desarrollo de Producción

Un desarrollador probó el modelo Qwen3.5-35B-A3B-UD-Q6_K_XL en múltiples proyectos reales de clientes, logrando un rendimiento sólido con puntuaciones de referencia de 1504pp2048 y 47.71 tg256, y velocidades de token de 80tps en una sola GPU.

OpenClawRadar
Claude Code + MCP genera suites de pruebas a partir del código fuente
Herramientas

Claude Code + MCP genera suites de pruebas a partir del código fuente

Claude Code analiza el código fuente para generar suites de pruebas jerárquicas que cubren módulos, características, escenarios, casos felices, casos límite y manejo de errores, luego las envía a sistemas de gestión de pruebas a través de MCP.

OpenClawRadar
Panel de Grafana de código abierto rastrea costos y uso de Claude Code mediante OpenTelemetry
Herramientas

Panel de Grafana de código abierto rastrea costos y uso de Claude Code mediante OpenTelemetry

Un SRE creó un panel de Grafana gratuito para visualizar el gasto de Claude Code, el uso de tokens, las tasas de acierto de caché y las decisiones de edición, extrayendo métricas de OpenTelemetry en backends compatibles con Prometheus.

OpenClawRadar
Cavernícola: Una Habilidad de Código de Claude que Reduce un 75% de Tokens Usando Habla al Estilo Cavernícola
Herramientas

Cavernícola: Una Habilidad de Código de Claude que Reduce un 75% de Tokens Usando Habla al Estilo Cavernícola

Caveman es una habilidad de Claude Code que reduce el uso de tokens en aproximadamente un 75% al hacer que Claude responda en un estilo conciso, similar al de un cavernícola, manteniendo la precisión técnica completa. Se instala mediante npx o el mercado de complementos de Claude.

OpenClawRadar