Bonsai 27B: Primeiro modelo da classe 27B é executado em um smartphone — Pontuações de benchmark e especificações

A PrismML lançou o Bonsai 27B, o primeiro modelo da classe de 27 bilhões de parâmetros que cabe e funciona em um celular. Baseado no Qwen 3.6 27B, ele usa quantização extrema de baixa precisão — pesos ternários ou binários — para reduzir o modelo para 3,9 GB (variante 1-bit) ou 5,9 GB (variante ternária), em comparação com 54 GB em precisão de 16 bits.
Duas Variantes: Ternária vs 1-bit
- Bonsai 27B Ternário: pesos em {−1, 0, +1} com escala de grupo FP16, 1,71 bits efetivos por peso. Tamanho: 5,9 GB. Focado em laptops com raciocínio completo, chamada de ferramentas e capacidade agentiva.
- Bonsai 27B 1-bit: pesos binários {−1, +1}, 1,125 bits efetivos por peso. Tamanho: 3,9 GB. Cabe no orçamento de memória do iPhone 17 Pro.
Ambas as variantes executam toda a rede (embeddings, atenção, MLPs, cabeça LM) em baixa precisão — sem escapes de alta precisão. Elas suportam contexto de 262 mil tokens, visão multimodal (torre de visão 4-bit) e decodificação especulativa.
Pontuações em Benchmarks (modo de raciocínio)
Em uma suíte de 15 benchmarks:
- Matemática (GSM8K, MATH-500, AIME25, AIME26): Qwen 3.6 27B 95,3, Ternário 93,4, 1-bit 91,7
- Programação (HumanEval+, MBPP+, LiveCodeBench): 88,7 → 86,0 → 81,9
- Agentivo/Chamada de ferramentas (BFCL v3, TauBench): 80,0 → 74,0 → 66,0
- Segue instruções (IFEval, IFBench): 78,4 → 71,8 → 65,8
- Conhecimento/STEM (MMLU-Redux, MuSR): 83,1 → 77,0 → 73,4
- Visão (MMMU Pro, OCRBench): 72,6 → 65,2 → 59,6
- Geral: 85,0 → 80,5 (95% de retenção) → 76,1 (90% de retenção)
Matemática e programação são as menos afetadas — essenciais para cargas de trabalho agentivas. A variante 1-bit com 3,9 GB é menor que um modelo 2B em precisão total, mas oferece inteligência de classe 27B.
Por que a Execução Local é Importante para Agentes
Cargas de trabalho agentivas exigem muitas chamadas sequenciais de modelo — cada uma carregando contexto e produzindo saída estruturada. A execução apenas na nuvem significa latência por etapa, custos acumulativos de tokens e envio de dados privados (capturas de tela, arquivos) pela rede. Executar localmente elimina essas limitações. O Bonsai 27B possibilita raciocínio multi-etapas, chamadas de ferramentas e loops agentivos de uso de computador no dispositivo.
Licenciamento e Disponibilidade
Ambas as variantes estão disponíveis hoje sob a Licença Apache 2.0.
📖 Leia a fonte completa: HN AI Agents
👀 See Also

Minions da Stripe: Aumentando a Produtividade dos Desenvolvedores com Agentes de Codificação End-to-End de Única Passagem
Os Minions da Stripe são agentes de codificação pontuais e de ponta a ponta projetados para aumentar a produtividade dos desenvolvedores automatizando tarefas complexas dentro do ecossistema Stripe.

Anthropic Lança Rede de Parceiros Claude com Investimento de US$ 100 Milhões
A Anthropic está lançando a Rede de Parceiros Claude com um investimento inicial de US$ 100 milhões para 2026, oferecendo treinamento, suporte técnico e desenvolvimento conjunto de mercado para organizações que ajudam empresas a adotar o Claude. Os parceiros obtêm acesso à certificação técnica, um Portal do Parceiro com materiais de treinamento e um kit inicial de Modernização de Código para migração de código legado.

Competição de Proteômica da Bohrium AI 2026 com Prêmio de US$ 13 mil e Suporte de Computação
A Bohrium está realizando uma competição de proteômica com IA em 2026, com um prêmio de US$ 13.000, oportunidades de estágio e suporte computacional. A competição foi discutida no Hacker News, recebendo 17 pontos e 5 comentários.

Anthropic usa o Google Forms para feedback do Claude
Anthropic, a empresa por trás do Claude, usa um Google Forms de 2008 para coletar feedback de design em vez de criar uma ferramenta personalizada—destacando uma filosofia pragmática de construir vs. comprar.