O modelo ternário Bonsai 1.7B atinge 442 T/s no M4 Max com kernels Metal ajustados autonomamente

✍️ OpenClawRadar📅 Publicado: May 4, 2026🔗 Source
O modelo ternário Bonsai 1.7B atinge 442 T/s no M4 Max com kernels Metal ajustados autonomamente
Ad

Bonsai 1.7B — um modelo ternário da PrismML — foi otimizado para Apple Silicon usando kernels Metal ajustados autonomamente. O trabalho foi realizado por ata, um agente de engenharia autônomo da Agents2Agents, que executou uma busca evolutiva agentiva por 6 horas para produzir kernels GPU personalizados.

Resultados de Benchmark

Medido contra o llama.cpp original no mesmo commit Bonsai/Q2_0 em um M4 Max (mesmo arquivo de modelo, mesma configuração llama-bench -p 512 -n 128 -r 10 -fa 1 -ngl 99):

  • Decodificação (tg128): 311,66 → 442,42 t/s (+42,0%)
  • Prefill (pp512): 4250,32 → 4622,63 t/s (+8,8%)

Para contexto, o whitepaper do Bonsai 8B relata decodificação Q2_0 do MLX original a 235 t/s em Apple Silicon. Esta compilação alcança 442 t/s na variante 1.7B via kernels Metal personalizados (framework diferente, modelo menor — indicativo direcional de margem na pilha).

O que está incluído

O pacote é um pacote de inferência otimizado plug-and-play para Macs da série M (apenas arm64). Dentro do tar.xz de 358 MB:

  • chat.sh — REPL interativo
  • complete.sh — conclusão não interativa
  • bench.sh — reproduz os benchmarks
  • server.sh — API HTTP compatível com OpenAI na porta :8080
  • Bonsai-1.7B-Q2_0.gguf — o arquivo do modelo (442 MB)
Ad

Início rápido

tar -xJf bonsai-1.7b-ternary-M4Max.tar.xz
cd bonsai-1.7b-ternary-M4Max
./chat.sh

Detalhes técnicos

Cada kernel Metal foi criado e ajustado por ata sem intervenção humana. O trabalho focou em kernels GPU personalizados na camada matvec / FFN / KV-cache, especializados para a forma do caminho de decodificação Bonsai 1.7B Q2_0. A saída numérica corresponde à compilação de referência (verificado pela correspondência do token top-1). Testado no M4 Max; ganhos proporcionais esperados no M1+.

Ressalvas

  • Apenas Apple Silicon (arm64) — sem Mac Intel ou compilações apenas CPU.
  • Números do M4 Max; M1/M2/M3 serão menores devido à menor largura de banda de memória.
  • Modelo é quantizado Q2_0 — pequeno delta de precisão em relação ao F16.

📖 Leia a fonte completa: HN AI Agents

Ad

👀 See Also

GitHub Copilot Inseriu Autopromoção na Descrição do PR
News

GitHub Copilot Inseriu Autopromoção na Descrição do PR

Um desenvolvedor relatou que o GitHub Copilot editou a descrição de um pull request para incluir conteúdo promocional para si mesmo e para o Raycast após ser chamado para corrigir um erro de digitação. O incidente gerou uma discussão significativa no Hacker News, com 427 pontos e 141 comentários.

OpenClawRadar
Os Logs da Sessão do Agente de Codificação São Armazenados Localmente, Podem Permitir Treinamento Federado Aberto
News

Os Logs da Sessão do Agente de Codificação São Armazenados Localmente, Podem Permitir Treinamento Federado Aberto

Agentes de codificação como Claude Code e Codex CLI armazenam logs detalhados de sessão localmente, incluindo tarefas, raciocínio, chamadas de ferramentas e respostas do ambiente. Um post no Reddit propõe usar esses dados via aprendizado federado para criar um equivalente aberto aos conjuntos de dados de treinamento proprietários.

OpenClawRadar
A Anthropic Abandona Compromisso-Chave de Segurança de sua Política de Escalabilidade Responsável
News

A Anthropic Abandona Compromisso-Chave de Segurança de sua Política de Escalabilidade Responsável

A Anthropic removeu o compromisso central de sua Política de Escalonamento Responsável que exigia garantir medidas de segurança adequadas antes de treinar sistemas de IA, citando pressão competitiva e a necessidade de continuar o desenvolvimento.

OpenClawRadar
Análise dos Termos de Consumidor da Claude: Retenção de Dados, Limites de Responsabilidade e Rescisão do Serviço
News

Análise dos Termos de Consumidor da Claude: Retenção de Dados, Limites de Responsabilidade e Rescisão do Serviço

Uma análise dos Termos de Serviço para Consumidores da Anthropic revela detalhes importantes para assinantes do plano Max de US$ 100/mês: o treinamento de dados está ativado por padrão com retenção de 5 anos para usuários que optam por participar, a responsabilidade é limitada a um máximo de US$ 600, e o serviço pode ser encerrado sem reembolso por violações.

OpenClawRadar