Bonsai 1.7B Modelo Ternario Alcanza 442 T/s en M4 Max con Núcleos Metal Ajustados Autónomamente

Bonsai 1.7B — un modelo ternario de PrismML — ha sido optimizado para Apple Silicon mediante kernels Metal ajustados de forma autónoma. El trabajo fue realizado por ata, un agente de ingeniería autónomo de Agents2Agents, que ejecutó una búsqueda evolutiva durante 6 horas para producir kernels GPU personalizados.
Resultados de las pruebas
Medidos contra llama.cpp original en el mismo commit de Bonsai/Q2_0 en un M4 Max (mismo archivo de modelo, misma configuración llama-bench -p 512 -n 128 -r 10 -fa 1 -ngl 99):
- Decodificación (tg128): 311.66 → 442.42 t/s (+42.0%)
- Prefill (pp512): 4250.32 → 4622.63 t/s (+8.8%)
Para contexto, el informe técnico de Bonsai 8B reporta una decodificación Q2_0 de 235 t/s en Apple Silicon con MLX. Esta versión alcanza 442 t/s en la variante 1.7B mediante kernels Metal personalizados (diferente framework, modelo más pequeño — indica de forma direccional el margen disponible en la pila).
Qué incluye
El paquete es una solución de inferencia optimizada lista para usar en Macs con chip M-series (solo arm64). Dentro del archivo tar.xz de 358 MB:
chat.sh— REPL interactivocomplete.sh— finalización no interactivabench.sh— reproduce las pruebas de rendimientoserver.sh— API HTTP compatible con OpenAI en :8080Bonsai-1.7B-Q2_0.gguf— el archivo del modelo (442 MB)
Inicio rápido
tar -xJf bonsai-1.7b-ternary-M4Max.tar.xz
cd bonsai-1.7b-ternary-M4Max
./chat.shDetalles técnicos
Cada kernel Metal fue creado y ajustado por ata sin intervención humana. El trabajo se centró en kernels GPU personalizados a nivel de las capas matvec / FFN / KV-cache, especializados para la forma del camino de decodificación de Bonsai 1.7B Q2_0. La salida numérica coincide con la versión de referencia (verificado mediante coincidencia del token top-1). Probado en M4 Max; se esperan mejoras proporcionales en M1+.
Advertencias
- Solo Apple Silicon (arm64) — no hay versiones para Mac Intel o solo CPU.
- Números obtenidos en M4 Max; M1/M2/M3 serán inferiores debido a menor ancho de banda de memoria.
- El modelo está cuantificado a Q2_0 — pequeña diferencia de precisión frente a F16.
📖 Lee la fuente completa: HN AI Agents
👀 Ver también
Qwen3 27B supera a Gemma 4 26B en uso real de herramientas para un pipeline local de video con IA
Un experimento local de pipeline de video con IA muestra que Qwen3 27B maneja la llamada a herramientas limpiamente, mientras que Gemma 4 26B se quedó atascada en bucles. También cubre Said Image Turbo para generación local de imágenes y la orquestación OpenCode alcanzando 174K de contexto.
La marca de agua de texto de Anthropic en Claude: explicación de la esteganografía semántica
La nueva marca de agua de texto de Anthropic manipula la elección de tokens para incrustar huellas, contradiciendo su afirmación de ser 'imperceptible'. Gruber desglosa la técnica de listas verde/roja.
Opus 4.7 puede seguir ~500 instrucciones, frente a ~150 hace un año
Investigación actualizada en mayo de 2026 muestra que Opus 4.7 puede seguir de manera confiable ~500 instrucciones, en comparación con ~150 en julio de 2025. GPT-5.5 maneja ~5000. Implicaciones para el tamaño del archivo CLAUDE.md.

Claude Code v2.1.196: Modelos predeterminados de organización, corrección de seguridad, recuperación de trabajos en segundo plano
Claude Code v2.1.196 agrega modelos predeterminados de organización, corrige un problema de seguridad con la generación de servidores MCP, mejora la confiabilidad de las sesiones en segundo plano y reduce el uso de tokens en /code-review en un 25%.