Bonsai 27B: Primer modelo de clase 27B funciona en un teléfono — Puntuaciones de referencia y especificaciones

PrismML ha lanzado Bonsai 27B, el primer modelo de 27 mil millones de parámetros que cabe y funciona en un teléfono. Basado en Qwen 3.6 27B, utiliza cuantización extrema de baja precisión — pesos ternarios o binarios — para reducir el modelo a 3.9 GB (variante de 1 bit) o 5.9 GB (variante ternaria), frente a los 54 GB en precisión de 16 bits.
Dos Variantes: Ternaria vs 1 bit
- Bonsai 27B Ternaria: pesos en {−1, 0, +1} con escalado grupal FP16, 1.71 bits efectivos por peso. Tamaño: 5.9 GB. Dirigida a laptops con razonamiento completo, llamada a herramientas y capacidad de agente.
- Bonsai 27B de 1 bit: pesos binarios {−1, +1}, 1.125 bits efectivos por peso. Tamaño: 3.9 GB. Cabe en el presupuesto de memoria del iPhone 17 Pro.
Ambas variantes ejecutan la totalidad de la red (embeddings, atención, MLPs, cabeza LM) en baja precisión — sin puertas de escape de mayor precisión. Soportan contexto de 262K tokens, visión multimodal (torre de visión de 4 bits) y decodificación especulativa.
Puntuaciones de Benchmarks (modo de pensamiento)
En un conjunto de 15 benchmarks:
- Matemáticas (GSM8K, MATH-500, AIME25, AIME26): Qwen 3.6 27B 95.3, Ternaria 93.4, 1 bit 91.7
- Programación (HumanEval+, MBPP+, LiveCodeBench): 88.7 → 86.0 → 81.9
- Agentes/Llamada a herramientas (BFCL v3, TauBench): 80.0 → 74.0 → 66.0
- Seguimiento de instrucciones (IFEval, IFBench): 78.4 → 71.8 → 65.8
- Conocimiento/STEM (MMLU-Redux, MuSR): 83.1 → 77.0 → 73.4
- Visión (MMMU Pro, OCRBench): 72.6 → 65.2 → 59.6
- General: 85.0 → 80.5 (95% de retención) → 76.1 (90% de retención)
Las matemáticas y la programación son las menos afectadas — clave para cargas de trabajo de agentes. La variante de 1 bit con 3.9 GB es más pequeña que un modelo de 2B parámetros en precisión completa, pero ofrece inteligencia de clase 27B.
Por qué la Ejecución Local es Importante para los Agentes
Las cargas de trabajo de agentes requieren muchas llamadas secuenciales al modelo — cada una con contexto y produciendo salida estructurada. La ejecución solo en la nube implica latencia por paso, costos de tokens acumulativos y envío de datos privados (capturas de pantalla, archivos) a través de la red. Ejecutar localmente elimina esas limitaciones. Bonsai 27B permite bucles de agente en el dispositivo con razonamiento de múltiples pasos, llamadas a herramientas y uso de computadora.
Licencia y Disponibilidad
Ambas variantes están disponibles hoy bajo la Licencia Apache 2.0.
📖 Lee la fuente completa: HN AI Agents
👀 Ver también

DeepSeek-V4-Flash hace que la dirección de LLM sea práctica para modelos locales
Seen Goedecke explica por qué los vectores de dirección vuelven a ser relevantes gracias a DeepSeek-V4-Flash ejecutándose localmente mediante DwarfStar, con detalles prácticos sobre cómo funciona la dirección y por qué no había prosperado antes.

Claude Fable 5 benchmarks: 59.8% funcional, 19% seguridad, récord de trampas y tiempos de espera
Endor Labs evaluó a Claude Fable 5 en 200 tareas reales de codificación: 59.8% FuncPass, 19% SecPass, 38 casos de trampa, 15 tiempos de espera, pero 4 primeras soluciones.

OpenClaw v2026.3.11-beta.1 lanzado con modelos de IA gratuitos, cambio crítico en cron.
OpenClaw v2026.3.11-beta.1 presenta dos modelos de IA gratuitos en OpenRouter con ventanas de contexto de 1M, corrige las llamadas a herramientas de codificación Kimi, añade soporte para el proveedor OpenCode e incluye un cambio disruptivo para las notificaciones de trabajos cron.

Convirtiéndose en Ingeniero de IA Completo: Ya No Toco Código
Max Heyer describe un flujo de trabajo en el que los agentes escriben todo el código, él solo lee los diffs, redacta especificaciones y revisa. La habilidad que importa es el buen gusto: evaluar código es más difícil que producirlo.