Bonsái 2 (Qwen 3.8 27B) como respaldo de OpenClaw: 8 GB, 85 tok/s en una 5070
El Ternary-Bonsai-2-27B de PrismML es una compilación cuantizada de Qwen3 3.8 27B que un usuario de r/openclaw está ejecutando localmente como modelo de respaldo de OpenClaw cuando se le agotan las cuotas de ChatGPT y Grok. Su afirmación: ~8GB de huella, 98% de la calidad del Qwen3 27B base retenida, y soporte de texto más visión.
Cifras de la configuración
- Velocidad de salida: 85 tok/s
- Hardware: RTX 5070 con 16GB de VRAM, 64GB de memoria del sistema
- Huella en disco: ~8GB
- Retención de calidad: reportada del 98% del Qwen3 3.8 27B
Los dos GGUFs que necesitas
Los archivos provienen del repositorio prism-ml/Ternary-Bonsai-2-27B-gguf en Hugging Face:
Ternary-Bonsai-2-27B-PQ2_0.gguf (texto) Ternary-Bonsai-2-27B-mmproj-Q8_0.gguf (visión)
Ambos son necesarios si quieres la ruta multimodal — el archivo mmproj es el proyector de visión, el archivo PQ2_0 son los pesos de texto ternarizados.
Notas de configuración
Bonsai 2 requiere el fork propio de llama.cpp de PrismML — no se cargará en el llama.cpp estándar. El autor hizo que GPT configurara el fork en una máquina de IA separada del host de OpenClaw, con el modelo configurado para:
- Cargarse dinámicamente cuando OpenClaw lo llama
- Descargarse tras 10 minutos de inactividad
- Actuar como respaldo cuando GPT 5.6 y Grok alcanzan los límites de uso
Lo que realmente hizo
Lo interesante no son los tok/s — es el comportamiento agéntico. Según la publicación, manejó búsquedas web mediante un navegador, control de VM, instalación y uso de software nuevo, y ejecución de flujos de trabajo existentes, hasta el punto de que el autor dice que "no puede notar que no es un modelo de frontera".
Eso es el informe de un solo usuario, no un benchmark, así que toma las afirmaciones de calidad como anecdóticas. El patrón de cargar/descargar en inactividad es la conclusión práctica: mantiene un 27B local residente solo cuando tu proveedor de pago está limitado por tasa, lo cual es una forma sensata de evitar quemar VRAM permanentemente en una máquina que también hace otro trabajo.
Si tienes una GPU con 16GB+ de VRAM, el par PQ2_0 + mmproj es lo suficientemente pequeño como para valer la pena probarlo con tus propias tareas agénticas antes de decidir si te aguanta.
📖 Lee la fuente completa: r/openclaw
👀 Ver también
Memoria Multiagente: Sistema de Memoria Compartida de Código Abierto para Agentes de IA
Multi-Agent Memory es un proyecto de código abierto que proporciona un sistema de memoria compartida para agentes de IA en diferentes máquinas, herramientas y marcos de trabajo. Admite cuatro tipos de memoria distintos con comportamientos específicos e incluye funciones como depuración de credenciales, aislamiento de agentes y consolidación de LLM.

Qwen 3.5 35B ejecutándose en 8GB de VRAM con configuración de llama.cpp
Un desarrollador comparte su configuración de llama.cpp para ejecutar Qwen 3.5 35B (Q4_K_M GGUF) en una RTX 4060m con 8 GB de VRAM, logrando 700 t/s de procesamiento de prompt y 42 t/s de generación, y comenta el uso de Cline en VSCode con los modos kat-coder-pro y qwen3.5.

LogClaw: SRE de IA de Código Abierto para Auto-Ticketing a partir de Registros
LogClaw es una plataforma de inteligencia de registros de código abierto que se ejecuta en Kubernetes, ingiere registros mediante OpenTelemetry, detecta anomalías utilizando puntuación compuesta basada en señales y crea automáticamente tickets con análisis de causa raíz en aproximadamente 90 segundos.

Dominando los Modos de Suscripción Antropic: Haiku, Soneto y Ópera
Explora los modos de suscripción innovadores de Antropic: Haiku, Soneto y Ópera, diseñados para mejorar tu experiencia de codificación con IA a través de características y precios personalizados.