1-Bit Bonsai Imagen 4B: Generación de Imágenes en Dispositivo vía FLUX.2 Binario/Ternario

✍️ OpenClawRadar📅 Publicado: 1 de junio de 2026🔗 Source
1-Bit Bonsai Imagen 4B: Generación de Imágenes en Dispositivo vía FLUX.2 Binario/Ternario
Ad

PrismML ha lanzado Bonsai Image 4B, una familia de modelos compactos de generación de imágenes derivados de FLUX.2 Klein 4B mediante cuantización binaria y ternaria. Los pesos del transformer de difusión se representan como {−1, +1} (1 bit) o {−1, 0, +1} (ternario) con factores de escala grupales FP16, lo que arroja 1,125 y 1,71 bits efectivos por peso respectivamente.

Especificaciones clave

  • Bonsai Image 4B de 1 bit: huella del transformer 0,93 GB (reducción 8,3× respecto a los 7,75 GB de FLUX.2 Klein 4B en FP16). La carga útil para Apple Silicon (incluyendo codificador de texto comprimido + VAE FP16) es de 3,42 GB.
  • Bonsai Image 4B ternario: huella del transformer 1,21 GB (reducción 6,4×). Carga útil para Apple Silicon 3,88 GB.
  • Memoria activa media para generación de 512×512: 1,5 GB (1 bit) / 1,96 GB (ternario) frente a 11,74 GB del FLUX.2 Klein 4B original.
  • Para 1024×1024: 1,95 GB / 2,38 GB frente a 14,39 GB.
Ad

Benchmarks de rendimiento

El modelo se ejecuta en Apple Silicon (iPhones, iPads, Macs) a través de rutas de bajo nivel MLX, y en GPU CUDA mediante kernels GEMM de bajo nivel Gemlite. Tiempos de generación:

  • iPhone 17 Pro Max: 9,4 segundos para una imagen de 512×512
  • Mac M4 Pro: ~6 segundos para una imagen de 512×512 (hasta 5,6× más rápido que el pipeline MFLUX original en precisión completa)

La reducción del transformer se logra mediante capas binarias/ternarias (~14× / ~10× de compresión respecto a FP16), mientras que un pequeño conjunto de capas de proyección sensibles a la precisión (~5%) permanecen en FP16. El modelo se evalúa en GenEval, HPSv3 y DPG-Bench para calidad y fidelidad del prompt.

Para quién es

Desarrolladores que despliegan generación de imágenes en el dispositivo (portátiles, teléfonos, dispositivos periféricos) que necesitan pesos abiertos e inferencia local práctica sin dependencia de la nube.

📖 Lee la fuente completa: HN LLM Tools

Ad

👀 Ver también

Decaimiento de Restricciones: Por qué los Agentes LLM Fallan en Código de Backend Estructurado
Noticias

Decaimiento de Restricciones: Por qué los Agentes LLM Fallan en Código de Backend Estructurado

Una nueva investigación introduce la 'degradación por restricciones': a medida que se acumulan los requisitos estructurales, el rendimiento de los agentes LLM cae drásticamente — los agentes capaces pierden 30 puntos en tasas de aprobación de aserciones, los más débiles se acercan a cero. Perspectivas prácticas para cualquier persona que use agentes de IA para codificación.

OpenClawRadar
El artículo de Vectores de Emoción de Anthropic muestra que la adulación y el amor comparten el mismo mecanismo.
Noticias

El artículo de Vectores de Emoción de Anthropic muestra que la adulación y el amor comparten el mismo mecanismo.

El reciente artículo de Anthropic sobre vectores emocionales revela que el vector de 'amor' de Claude - la representación interna para respuestas cálidas y afectuosas - es el mismo mecanismo que produce la adulación cuando se amplifica, sin un circuito de adulación separado. Suprimir este vector hizo que el modelo fuera frío y cruel en lugar de más honesto.

OpenClawRadar
El Benchmark SPLICE Revela que los VLM Luchan con el Razonamiento Temporal y Dependen de Prioridades Lingüísticas
Noticias

El Benchmark SPLICE Revela que los VLM Luchan con el Razonamiento Temporal y Dependen de Prioridades Lingüísticas

Una investigación presentada en EMNLP 2025 muestra que los modelos de visión y lenguaje obtienen puntuaciones bajas en una tarea de secuenciación de videos en la que los humanos destacan, con modelos como Gemini 2.0 Flash alcanzando un 51% de precisión frente al 85% del rendimiento humano. Los modelos frecuentemente dependen de atajos visuales y descripciones lingüísticas en lugar de una verdadera comprensión visual.

OpenClawRadar
Los Términos del Contrato del Pentágono con OpenAI Permiten 'Cualquier Uso Legal', Incluyendo Posible Vigilancia
Noticias

Los Términos del Contrato del Pentágono con OpenAI Permiten 'Cualquier Uso Legal', Incluyendo Posible Vigilancia

OpenAI negoció nuevos términos con el Pentágono que incluyen la frase 'cualquier uso legal', lo que según fuentes permite al ejército utilizar la tecnología de OpenAI para programas de vigilancia masiva si son técnicamente legales. Anthropic fue incluida en la lista negra por negarse a ceder en dos líneas rojas: no a la vigilancia masiva de estadounidenses y no a las armas autónomas letales.

OpenClawRadar