Bonsai 1.7B Modelo Ternario Alcanza 442 T/s en M4 Max con Núcleos Metal Ajustados Autónomamente

Bonsai 1.7B — un modelo ternario de PrismML — ha sido optimizado para Apple Silicon mediante kernels Metal ajustados de forma autónoma. El trabajo fue realizado por ata, un agente de ingeniería autónomo de Agents2Agents, que ejecutó una búsqueda evolutiva durante 6 horas para producir kernels GPU personalizados.
Resultados de las pruebas
Medidos contra llama.cpp original en el mismo commit de Bonsai/Q2_0 en un M4 Max (mismo archivo de modelo, misma configuración llama-bench -p 512 -n 128 -r 10 -fa 1 -ngl 99):
- Decodificación (tg128): 311.66 → 442.42 t/s (+42.0%)
- Prefill (pp512): 4250.32 → 4622.63 t/s (+8.8%)
Para contexto, el informe técnico de Bonsai 8B reporta una decodificación Q2_0 de 235 t/s en Apple Silicon con MLX. Esta versión alcanza 442 t/s en la variante 1.7B mediante kernels Metal personalizados (diferente framework, modelo más pequeño — indica de forma direccional el margen disponible en la pila).
Qué incluye
El paquete es una solución de inferencia optimizada lista para usar en Macs con chip M-series (solo arm64). Dentro del archivo tar.xz de 358 MB:
chat.sh— REPL interactivocomplete.sh— finalización no interactivabench.sh— reproduce las pruebas de rendimientoserver.sh— API HTTP compatible con OpenAI en :8080Bonsai-1.7B-Q2_0.gguf— el archivo del modelo (442 MB)
Inicio rápido
tar -xJf bonsai-1.7b-ternary-M4Max.tar.xz
cd bonsai-1.7b-ternary-M4Max
./chat.shDetalles técnicos
Cada kernel Metal fue creado y ajustado por ata sin intervención humana. El trabajo se centró en kernels GPU personalizados a nivel de las capas matvec / FFN / KV-cache, especializados para la forma del camino de decodificación de Bonsai 1.7B Q2_0. La salida numérica coincide con la versión de referencia (verificado mediante coincidencia del token top-1). Probado en M4 Max; se esperan mejoras proporcionales en M1+.
Advertencias
- Solo Apple Silicon (arm64) — no hay versiones para Mac Intel o solo CPU.
- Números obtenidos en M4 Max; M1/M2/M3 serán inferiores debido a menor ancho de banda de memoria.
- El modelo está cuantificado a Q2_0 — pequeña diferencia de precisión frente a F16.
📖 Lee la fuente completa: HN AI Agents
👀 Ver también
Startups de IA publican menos investigación: Lo que significa para el código abierto y los desarrolladores
Las principales startups de IA están publicando significativamente menos investigaciones, lo que genera preocupaciones sobre la transparencia y la reproducibilidad en el campo.

Diagnósticos de Caché de Mensajes de Claude: Hilo de Estadísticas Revela una Tasa de Lectura de Caché del 98.9%
Hace dos días, Claude lanzó diagnósticos de caché de prompts en Console. Un desarrollador reporta una tasa de lectura de caché del 98.9%, con el 80% de los fallos debidos a cambios en los mensajes.

La IA no eliminó tu base de datos, lo hiciste tú: Responsabilidad en la era de los agentes de codificación de IA
Una historia viral culpaba a un agente de IA por eliminar una base de datos de producción, pero el verdadero problema es exponer endpoints de API destructivos y la falta de procesos, no la herramienta.

La IA debería elevar tu pensamiento, no reemplazarlo — Koshy John sobre la división oculta en la ingeniería
Koshy John argumenta que los ingenieros que externalizan el pensamiento a la IA para obtener ganancias de productividad a corto plazo están construyendo una base hueca, mientras que aquellos que usan la IA para eliminar tareas tediosas y operar a un nivel más alto crean valor real a largo plazo.