O modelo ternário Bonsai 1.7B atinge 442 T/s no M4 Max com kernels Metal ajustados autonomamente

Bonsai 1.7B — um modelo ternário da PrismML — foi otimizado para Apple Silicon usando kernels Metal ajustados autonomamente. O trabalho foi realizado por ata, um agente de engenharia autônomo da Agents2Agents, que executou uma busca evolutiva agentiva por 6 horas para produzir kernels GPU personalizados.
Resultados de Benchmark
Medido contra o llama.cpp original no mesmo commit Bonsai/Q2_0 em um M4 Max (mesmo arquivo de modelo, mesma configuração llama-bench -p 512 -n 128 -r 10 -fa 1 -ngl 99):
- Decodificação (tg128): 311,66 → 442,42 t/s (+42,0%)
- Prefill (pp512): 4250,32 → 4622,63 t/s (+8,8%)
Para contexto, o whitepaper do Bonsai 8B relata decodificação Q2_0 do MLX original a 235 t/s em Apple Silicon. Esta compilação alcança 442 t/s na variante 1.7B via kernels Metal personalizados (framework diferente, modelo menor — indicativo direcional de margem na pilha).
O que está incluído
O pacote é um pacote de inferência otimizado plug-and-play para Macs da série M (apenas arm64). Dentro do tar.xz de 358 MB:
chat.sh— REPL interativocomplete.sh— conclusão não interativabench.sh— reproduz os benchmarksserver.sh— API HTTP compatível com OpenAI na porta :8080Bonsai-1.7B-Q2_0.gguf— o arquivo do modelo (442 MB)
Início rápido
tar -xJf bonsai-1.7b-ternary-M4Max.tar.xz
cd bonsai-1.7b-ternary-M4Max
./chat.shDetalhes técnicos
Cada kernel Metal foi criado e ajustado por ata sem intervenção humana. O trabalho focou em kernels GPU personalizados na camada matvec / FFN / KV-cache, especializados para a forma do caminho de decodificação Bonsai 1.7B Q2_0. A saída numérica corresponde à compilação de referência (verificado pela correspondência do token top-1). Testado no M4 Max; ganhos proporcionais esperados no M1+.
Ressalvas
- Apenas Apple Silicon (arm64) — sem Mac Intel ou compilações apenas CPU.
- Números do M4 Max; M1/M2/M3 serão menores devido à menor largura de banda de memória.
- Modelo é quantizado Q2_0 — pequeno delta de precisão em relação ao F16.
📖 Leia a fonte completa: HN AI Agents
👀 See Also

Plataforma Polsia Mostra Padrões Repetitivos de SaaS em Lançamentos ao Vivo de Fundadores
Polsia é uma plataforma de negócios autônoma onde os usuários descrevem seu negócio, pagam dinheiro, e ela executa autonomamente. Um cientista comportamental observou 72 horas de lançamentos ao vivo de fundadores, identificando padrões repetitivos como soluções de automação de SDR com IA e mercados internacionais subatendidos.

Anthropic dobra os limites de taxa do Claude Code e remove limitação de pico para planos pagos
Anthropic dobrou os limites de taxa de 5 horas para Claude Code nos planos Pro, Max, Team e Enterprise, removeu a limitação de horário de pico e aumentou os limites de taxa da API para modelos Opus.
Claude Code v2.1.243: Análise de Loops, Seletor de Modelo, TTLs de Cache e Correções de Estabilidade
Claude Code v2.1.243 adiciona um detalhamento Loops em /usage, um seletor de modelo configurável, configurações de TTL para cache de prompt e correções para reconexão MCP, modo automático e mais.

Protocolo de Convergência Quumble v5: Resultados de Experimentos com LLM de Arquitetura Cruzada
O Protocolo de Convergência Quumble v5 testa se instâncias independentes de LLM convergem para descrições de criaturas imaginárias ao receberem palavras sem sentido. Os resultados mostram que tanto Claude (Opus 4.6 e Sonnet 4.6) quanto GPT-5.3 produziram independentemente uma criatura pequena, redonda, macia, com tonalidade lavanda, bioluminescente e que emite um zumbido a partir da palavra 'quumble'.