Compresión LLM sin Pérdidas con Codebook: Reducción de RAM del 10-25% mediante Empaquetamiento Bit a Bit

✍️ OpenClawRadar📅 Publicado: 15 de marzo de 2026🔗 Source
Compresión LLM sin Pérdidas con Codebook: Reducción de RAM del 10-25% mediante Empaquetamiento Bit a Bit
Ad

Un desarrollador ha publicado código de prueba de concepto para la compresión sin pérdida de LLM que reduce el uso de memoria en un 10-25% mediante el empaquetado genérico bit a bit de pesos indexados. La técnica intercambia algo de velocidad de inferencia por un tamaño de modelo más pequeño, haciendo posible ejecutar modelos más grandes en hardware con VRAM limitada.

Cómo funciona

El desarrollador comenzó preguntándose cuántos valores únicos existen realmente en las capas de LLM. El análisis reveló que, aunque fp16 usa 16 bits, la mayoría de los modelos solo utilizan alrededor de 12-13 bits de valores únicos. Al empaquetar estos valores en bloques, la técnica logra compresión sin perder precisión.

Características de rendimiento

  • Reducción de RAM: 10-25%+ en los modelos probados
  • Impacto en la velocidad: La velocidad de inferencia se reduce aproximadamente a la mitad en las pruebas de ejemplo
  • Hardware de prueba: NVIDIA P2200 (5GB) y CPU, con actualizaciones en desarrollo para AMD MI50 (32GB)
Ad

Detalles de implementación

El desarrollador trabajó en este proyecto durante varias semanas utilizando asistentes de codificación con IA, incluidos Claude, Qwen y Gemini. El repositorio incluye versiones sin pérdida y con pérdida/equilibradas, aunque la versión con pérdida aún no ha sido probada extensamente.

El desarrollador sugiere que este enfoque de compresión podría servir como una forma de medir la "compacidad" de un modelo: qué tan eficientemente utiliza su espacio de parámetros.

Disponibilidad del código

El código de prueba de concepto está disponible en GitHub: https://github.com/bigattichouse/Codebook-Quantization

📖 Read the full source: r/LocalLLaMA

Ad

👀 Ver también

Script de Python de 80 líneas usa Claude para generar sugerencias de enlaces internos automáticamente, reduciendo el tiempo de enlace de 2 horas a 8 minutos
Herramientas

Script de Python de 80 líneas usa Claude para generar sugerencias de enlaces internos automáticamente, reduciendo el tiempo de enlace de 2 horas a 8 minutos

Un usuario de Reddit creó un script de Python de 80 líneas que alimenta a Claude con un borrador de artículo y un mapa del sitio, obteniendo enlaces internos relevantes con texto ancla sugerido, reduciendo el tiempo de enlazado manual de 2 horas a 8 minutos por artículo.

OpenClawRadar
Gemma 4 26B vs Qwen 3.5 27B: Evaluación comparativa de flujos de trabajo empresariales locales en RTX 4090
Herramientas

Gemma 4 26B vs Qwen 3.5 27B: Evaluación comparativa de flujos de trabajo empresariales locales en RTX 4090

Un desarrollador probó Gemma 4 26B y Qwen 3.5 27B en una estación de trabajo RTX 4090 para 18 tareas reales de operador de negocios. Gemma ganó 13-5, mostrando mayor velocidad y mejor disciplina para el trabajo de ejecución diaria, mientras que Qwen sobresalió en el pensamiento estratégico más amplio.

OpenClawRadar
Código de Claude Utilizado para Simular Más de 4,000 Juegos de Hombre Lobo Ciego con LLMs
Herramientas

Código de Claude Utilizado para Simular Más de 4,000 Juegos de Hombre Lobo Ciego con LLMs

Un desarrollador utilizó Claude Code para construir un simulador donde los LLM juegan al Werewolf ciego de una noche, ejecutando aproximadamente 4,600 juegos en modelos de OpenAI y xAI. El experimento reveló patrones de votación consistentes basados en nombres a pesar de las señales mínimas del juego.

OpenClawRadar
Código abierto local cambia automáticamente entre modelos de Claude para reducir costos de IA.
Herramientas

Código abierto local cambia automáticamente entre modelos de Claude para reducir costos de IA.

Un desarrollador creó un gancho local para Cursor y Claude Code que analiza las indicaciones y selecciona automáticamente el modelo Claude apropiado (Haiku, Sonnet u Opus) antes de enviar las solicitudes. La herramienta utiliza reglas de palabras clave para clasificar tareas y bloquear escenarios de sobrepago, mostrando un análisis retrospectivo una reducción de costos del 50-70%.

OpenClawRadar