Bonsái 2 (Qwen 3.8 27B) como respaldo de OpenClaw: 8 GB, 85 tok/s en una 5070

✍️ OpenClawRadar📅 Publicado: 1 de octubre de 2026🔗 Source
Ad

El Ternary-Bonsai-2-27B de PrismML es una compilación cuantizada de Qwen3 3.8 27B que un usuario de r/openclaw está ejecutando localmente como modelo de respaldo de OpenClaw cuando se le agotan las cuotas de ChatGPT y Grok. Su afirmación: ~8GB de huella, 98% de la calidad del Qwen3 27B base retenida, y soporte de texto más visión.

Cifras de la configuración

  • Velocidad de salida: 85 tok/s
  • Hardware: RTX 5070 con 16GB de VRAM, 64GB de memoria del sistema
  • Huella en disco: ~8GB
  • Retención de calidad: reportada del 98% del Qwen3 3.8 27B

Los dos GGUFs que necesitas

Los archivos provienen del repositorio prism-ml/Ternary-Bonsai-2-27B-gguf en Hugging Face:

Ternary-Bonsai-2-27B-PQ2_0.gguf        (texto)
Ternary-Bonsai-2-27B-mmproj-Q8_0.gguf  (visión)

Ambos son necesarios si quieres la ruta multimodal — el archivo mmproj es el proyector de visión, el archivo PQ2_0 son los pesos de texto ternarizados.

Notas de configuración

Bonsai 2 requiere el fork propio de llama.cpp de PrismML — no se cargará en el llama.cpp estándar. El autor hizo que GPT configurara el fork en una máquina de IA separada del host de OpenClaw, con el modelo configurado para:

  • Cargarse dinámicamente cuando OpenClaw lo llama
  • Descargarse tras 10 minutos de inactividad
  • Actuar como respaldo cuando GPT 5.6 y Grok alcanzan los límites de uso
Ad

Lo que realmente hizo

Lo interesante no son los tok/s — es el comportamiento agéntico. Según la publicación, manejó búsquedas web mediante un navegador, control de VM, instalación y uso de software nuevo, y ejecución de flujos de trabajo existentes, hasta el punto de que el autor dice que "no puede notar que no es un modelo de frontera".

Eso es el informe de un solo usuario, no un benchmark, así que toma las afirmaciones de calidad como anecdóticas. El patrón de cargar/descargar en inactividad es la conclusión práctica: mantiene un 27B local residente solo cuando tu proveedor de pago está limitado por tasa, lo cual es una forma sensata de evitar quemar VRAM permanentemente en una máquina que también hace otro trabajo.

Si tienes una GPU con 16GB+ de VRAM, el par PQ2_0 + mmproj es lo suficientemente pequeño como para valer la pena probarlo con tus propias tareas agénticas antes de decidir si te aguanta.

📖 Lee la fuente completa: r/openclaw

Ad

👀 Ver también

🦀
Herramientas

Memoria Multiagente: Sistema de Memoria Compartida de Código Abierto para Agentes de IA

Multi-Agent Memory es un proyecto de código abierto que proporciona un sistema de memoria compartida para agentes de IA en diferentes máquinas, herramientas y marcos de trabajo. Admite cuatro tipos de memoria distintos con comportamientos específicos e incluye funciones como depuración de credenciales, aislamiento de agentes y consolidación de LLM.

OpenClawRadar
Qwen 3.5 35B ejecutándose en 8GB de VRAM con configuración de llama.cpp
Herramientas

Qwen 3.5 35B ejecutándose en 8GB de VRAM con configuración de llama.cpp

Un desarrollador comparte su configuración de llama.cpp para ejecutar Qwen 3.5 35B (Q4_K_M GGUF) en una RTX 4060m con 8 GB de VRAM, logrando 700 t/s de procesamiento de prompt y 42 t/s de generación, y comenta el uso de Cline en VSCode con los modos kat-coder-pro y qwen3.5.

OpenClawRadar
LogClaw: SRE de IA de Código Abierto para Auto-Ticketing a partir de Registros
Herramientas

LogClaw: SRE de IA de Código Abierto para Auto-Ticketing a partir de Registros

LogClaw es una plataforma de inteligencia de registros de código abierto que se ejecuta en Kubernetes, ingiere registros mediante OpenTelemetry, detecta anomalías utilizando puntuación compuesta basada en señales y crea automáticamente tickets con análisis de causa raíz en aproximadamente 90 segundos.

OpenClawRadar
Dominando los Modos de Suscripción Antropic: Haiku, Soneto y Ópera
Herramientas

Dominando los Modos de Suscripción Antropic: Haiku, Soneto y Ópera

Explora los modos de suscripción innovadores de Antropic: Haiku, Soneto y Ópera, diseñados para mejorar tu experiencia de codificación con IA a través de características y precios personalizados.

OpenClawRadar