Bonsai 27B: Primeiro modelo da classe 27B é executado em um smartphone — Pontuações de benchmark e especificações

✍️ OpenClawRadar📅 Publicado: July 15, 2026🔗 Source
Bonsai 27B: Primeiro modelo da classe 27B é executado em um smartphone — Pontuações de benchmark e especificações
Ad

A PrismML lançou o Bonsai 27B, o primeiro modelo da classe de 27 bilhões de parâmetros que cabe e funciona em um celular. Baseado no Qwen 3.6 27B, ele usa quantização extrema de baixa precisão — pesos ternários ou binários — para reduzir o modelo para 3,9 GB (variante 1-bit) ou 5,9 GB (variante ternária), em comparação com 54 GB em precisão de 16 bits.

Duas Variantes: Ternária vs 1-bit

  • Bonsai 27B Ternário: pesos em {−1, 0, +1} com escala de grupo FP16, 1,71 bits efetivos por peso. Tamanho: 5,9 GB. Focado em laptops com raciocínio completo, chamada de ferramentas e capacidade agentiva.
  • Bonsai 27B 1-bit: pesos binários {−1, +1}, 1,125 bits efetivos por peso. Tamanho: 3,9 GB. Cabe no orçamento de memória do iPhone 17 Pro.

Ambas as variantes executam toda a rede (embeddings, atenção, MLPs, cabeça LM) em baixa precisão — sem escapes de alta precisão. Elas suportam contexto de 262 mil tokens, visão multimodal (torre de visão 4-bit) e decodificação especulativa.

Ad

Pontuações em Benchmarks (modo de raciocínio)

Em uma suíte de 15 benchmarks:

  • Matemática (GSM8K, MATH-500, AIME25, AIME26): Qwen 3.6 27B 95,3, Ternário 93,4, 1-bit 91,7
  • Programação (HumanEval+, MBPP+, LiveCodeBench): 88,7 → 86,0 → 81,9
  • Agentivo/Chamada de ferramentas (BFCL v3, TauBench): 80,0 → 74,0 → 66,0
  • Segue instruções (IFEval, IFBench): 78,4 → 71,8 → 65,8
  • Conhecimento/STEM (MMLU-Redux, MuSR): 83,1 → 77,0 → 73,4
  • Visão (MMMU Pro, OCRBench): 72,6 → 65,2 → 59,6
  • Geral: 85,0 → 80,5 (95% de retenção) → 76,1 (90% de retenção)

Matemática e programação são as menos afetadas — essenciais para cargas de trabalho agentivas. A variante 1-bit com 3,9 GB é menor que um modelo 2B em precisão total, mas oferece inteligência de classe 27B.

Por que a Execução Local é Importante para Agentes

Cargas de trabalho agentivas exigem muitas chamadas sequenciais de modelo — cada uma carregando contexto e produzindo saída estruturada. A execução apenas na nuvem significa latência por etapa, custos acumulativos de tokens e envio de dados privados (capturas de tela, arquivos) pela rede. Executar localmente elimina essas limitações. O Bonsai 27B possibilita raciocínio multi-etapas, chamadas de ferramentas e loops agentivos de uso de computador no dispositivo.

Licenciamento e Disponibilidade

Ambas as variantes estão disponíveis hoje sob a Licença Apache 2.0.

📖 Leia a fonte completa: HN AI Agents

Ad

👀 See Also