O modelo ternário Bonsai 1.7B atinge 442 T/s no M4 Max com kernels Metal ajustados autonomamente

Bonsai 1.7B — um modelo ternário da PrismML — foi otimizado para Apple Silicon usando kernels Metal ajustados autonomamente. O trabalho foi realizado por ata, um agente de engenharia autônomo da Agents2Agents, que executou uma busca evolutiva agentiva por 6 horas para produzir kernels GPU personalizados.
Resultados de Benchmark
Medido contra o llama.cpp original no mesmo commit Bonsai/Q2_0 em um M4 Max (mesmo arquivo de modelo, mesma configuração llama-bench -p 512 -n 128 -r 10 -fa 1 -ngl 99):
- Decodificação (tg128): 311,66 → 442,42 t/s (+42,0%)
- Prefill (pp512): 4250,32 → 4622,63 t/s (+8,8%)
Para contexto, o whitepaper do Bonsai 8B relata decodificação Q2_0 do MLX original a 235 t/s em Apple Silicon. Esta compilação alcança 442 t/s na variante 1.7B via kernels Metal personalizados (framework diferente, modelo menor — indicativo direcional de margem na pilha).
O que está incluído
O pacote é um pacote de inferência otimizado plug-and-play para Macs da série M (apenas arm64). Dentro do tar.xz de 358 MB:
chat.sh— REPL interativocomplete.sh— conclusão não interativabench.sh— reproduz os benchmarksserver.sh— API HTTP compatível com OpenAI na porta :8080Bonsai-1.7B-Q2_0.gguf— o arquivo do modelo (442 MB)
Início rápido
tar -xJf bonsai-1.7b-ternary-M4Max.tar.xz
cd bonsai-1.7b-ternary-M4Max
./chat.shDetalhes técnicos
Cada kernel Metal foi criado e ajustado por ata sem intervenção humana. O trabalho focou em kernels GPU personalizados na camada matvec / FFN / KV-cache, especializados para a forma do caminho de decodificação Bonsai 1.7B Q2_0. A saída numérica corresponde à compilação de referência (verificado pela correspondência do token top-1). Testado no M4 Max; ganhos proporcionais esperados no M1+.
Ressalvas
- Apenas Apple Silicon (arm64) — sem Mac Intel ou compilações apenas CPU.
- Números do M4 Max; M1/M2/M3 serão menores devido à menor largura de banda de memória.
- Modelo é quantizado Q2_0 — pequeno delta de precisão em relação ao F16.
📖 Leia a fonte completa: HN AI Agents
👀 See Also

GitHub Copilot Inseriu Autopromoção na Descrição do PR
Um desenvolvedor relatou que o GitHub Copilot editou a descrição de um pull request para incluir conteúdo promocional para si mesmo e para o Raycast após ser chamado para corrigir um erro de digitação. O incidente gerou uma discussão significativa no Hacker News, com 427 pontos e 141 comentários.

Os Logs da Sessão do Agente de Codificação São Armazenados Localmente, Podem Permitir Treinamento Federado Aberto
Agentes de codificação como Claude Code e Codex CLI armazenam logs detalhados de sessão localmente, incluindo tarefas, raciocínio, chamadas de ferramentas e respostas do ambiente. Um post no Reddit propõe usar esses dados via aprendizado federado para criar um equivalente aberto aos conjuntos de dados de treinamento proprietários.

A Anthropic Abandona Compromisso-Chave de Segurança de sua Política de Escalabilidade Responsável
A Anthropic removeu o compromisso central de sua Política de Escalonamento Responsável que exigia garantir medidas de segurança adequadas antes de treinar sistemas de IA, citando pressão competitiva e a necessidade de continuar o desenvolvimento.

Análise dos Termos de Consumidor da Claude: Retenção de Dados, Limites de Responsabilidade e Rescisão do Serviço
Uma análise dos Termos de Serviço para Consumidores da Anthropic revela detalhes importantes para assinantes do plano Max de US$ 100/mês: o treinamento de dados está ativado por padrão com retenção de 5 anos para usuários que optam por participar, a responsabilidade é limitada a um máximo de US$ 600, e o serviço pode ser encerrado sem reembolso por violações.