Los modelos Bonsai 1-bit Qwen de PrismML probados: 107 t/s de generación con 8 GB de VRAM.

Modelos Bonsai: cuantización de 1 bit de Qwen por PrismML
PrismML ha lanzado Bonsai, un conjunto de versiones cuantizadas de 1 bit de los modelos Qwen3 (8B, 4B y 1.7B parámetros). Estos modelos utilizan una cuantización extrema para reducir drásticamente los requisitos de memoria mientras mantienen un rendimiento utilizable para ciertas tareas.
Puntos de referencia de rendimiento de las pruebas
Las pruebas en una RTX 4060 con 8GB de VRAM mostraron:
- Velocidad de generación de 107 tokens/segundo
- Procesamiento de prompts de >1114 tokens/segundo
- Uso de RAM significativamente menor en comparación con los modelos cuantizados Q4
Para comparar, Qwen 3.5 4B Q4 logró 56 t/s usando los mismos prompts en el mismo hardware.
Implicaciones prácticas
La reducida huella de memoria permite ejecutar modelos de 8B parámetros en sistemas con 8GB de VRAM. Los modelos más pequeños pueden usarse con ventanas de contexto más largas debido al ahorro de memoria.
Evaluación de calidad
Las pruebas iniciales se centraron en la síntesis de texto, donde el modelo se desempeñó bien. El evaluador notó que no evaluaron capacidades de codificación o uso de herramientas.
Limitaciones técnicas
La implementación actual tiene problemas de inferencia en CPU. Cuando se probó en una mini PC sin GPU:
- El fork de llama.cpp se compila exitosamente
- El modelo se carga pero se bloquea durante el procesamiento de prompts
- El análisis sugiere que no existe una implementación para CPU; probablemente descuantiza a FP32 e intenta una inferencia regular, lo que sería extremadamente lento en CPU
Potencial técnico
Los modelos de 1 bit podrían reducir no solo los requisitos de ancho de banda y memoria, sino también los de cómputo. La multiplicación de matrices en matrices de 1 bit podría usar operaciones XOR, que son mucho más rápidas que las operaciones de punto flotante. Incluso con escalado a FP16 después de las operaciones XOR, debería ser posible un ahorro significativo de cómputo, beneficiando potencialmente escenarios de inferencia solo con CPU y computación de borde.
Detalles de configuración
El evaluador descargó:
- El modelo Bonsai 8B
- El fork de llama.cpp de PrismML
- Probado en Windows con CUDA
📖 Read the full source: r/LocalLLaMA
👀 Ver también

ThinkPad, 34 años de trayectoria: del IBM 700C a las estaciones de trabajo AI de Lenovo
ThinkPad ha sido fabricado continuamente desde 1992 bajo IBM y Lenovo, con continuidad visual desde el 700C hasta el P14s Gen 6 AMD de 2026, que ejecuta cargas de trabajo LLM de 70B de forma local.

Actualización de OpenClaw .23 Causando Problemas en Agentes y Pérdida de Datos
La actualización OpenClaw .23 está provocando que los agentes se vuelvan irresponsivos, fallen en la ejecución de tareas y pierdan la conexión con las extensiones del navegador. Ejecutar el comando de reparación puede eliminar configuraciones JSON completas, requiriendo copias de seguridad del sistema para la recuperación.

Claude Code 2.1.84 añade un agente de propósito general y una herramienta PowerShell, y elimina indicaciones redundantes.
Claude Code 2.1.84 presenta un nuevo prompt de subagente de propósito general para operaciones en bases de código y una descripción de herramienta de PowerShell con pautas para evitar comandos de espera. La actualización elimina nueve prompts redundantes y simplifica múltiples descripciones de herramientas.

Militares de EE. UU. Usaron la IA Claude para Ataques en Irán A Pesar de la Prohibición de Trump
Según informes, las fuerzas armadas de EE. UU. utilizaron el modelo de IA Claude de Anthropic para inteligencia, selección de objetivos y simulaciones de campo de batalla durante los ataques conjuntos de EE. UU. e Israel contra Irán, a pesar de que Donald Trump ordenó a las agencias federales que dejaran de usar Claude horas antes del ataque.