Bonsai 27B: Primeiro modelo da classe 27B é executado em um smartphone — Pontuações de benchmark e especificações

A PrismML lançou o Bonsai 27B, o primeiro modelo da classe de 27 bilhões de parâmetros que cabe e funciona em um celular. Baseado no Qwen 3.6 27B, ele usa quantização extrema de baixa precisão — pesos ternários ou binários — para reduzir o modelo para 3,9 GB (variante 1-bit) ou 5,9 GB (variante ternária), em comparação com 54 GB em precisão de 16 bits.
Duas Variantes: Ternária vs 1-bit
- Bonsai 27B Ternário: pesos em {−1, 0, +1} com escala de grupo FP16, 1,71 bits efetivos por peso. Tamanho: 5,9 GB. Focado em laptops com raciocínio completo, chamada de ferramentas e capacidade agentiva.
- Bonsai 27B 1-bit: pesos binários {−1, +1}, 1,125 bits efetivos por peso. Tamanho: 3,9 GB. Cabe no orçamento de memória do iPhone 17 Pro.
Ambas as variantes executam toda a rede (embeddings, atenção, MLPs, cabeça LM) em baixa precisão — sem escapes de alta precisão. Elas suportam contexto de 262 mil tokens, visão multimodal (torre de visão 4-bit) e decodificação especulativa.
Pontuações em Benchmarks (modo de raciocínio)
Em uma suíte de 15 benchmarks:
- Matemática (GSM8K, MATH-500, AIME25, AIME26): Qwen 3.6 27B 95,3, Ternário 93,4, 1-bit 91,7
- Programação (HumanEval+, MBPP+, LiveCodeBench): 88,7 → 86,0 → 81,9
- Agentivo/Chamada de ferramentas (BFCL v3, TauBench): 80,0 → 74,0 → 66,0
- Segue instruções (IFEval, IFBench): 78,4 → 71,8 → 65,8
- Conhecimento/STEM (MMLU-Redux, MuSR): 83,1 → 77,0 → 73,4
- Visão (MMMU Pro, OCRBench): 72,6 → 65,2 → 59,6
- Geral: 85,0 → 80,5 (95% de retenção) → 76,1 (90% de retenção)
Matemática e programação são as menos afetadas — essenciais para cargas de trabalho agentivas. A variante 1-bit com 3,9 GB é menor que um modelo 2B em precisão total, mas oferece inteligência de classe 27B.
Por que a Execução Local é Importante para Agentes
Cargas de trabalho agentivas exigem muitas chamadas sequenciais de modelo — cada uma carregando contexto e produzindo saída estruturada. A execução apenas na nuvem significa latência por etapa, custos acumulativos de tokens e envio de dados privados (capturas de tela, arquivos) pela rede. Executar localmente elimina essas limitações. O Bonsai 27B possibilita raciocínio multi-etapas, chamadas de ferramentas e loops agentivos de uso de computador no dispositivo.
Licenciamento e Disponibilidade
Ambas as variantes estão disponíveis hoje sob a Licença Apache 2.0.
📖 Leia a fonte completa: HN AI Agents
👀 See Also

Postagem no Reddit critica fluxos de trabalho de Agentes CEO Virtuais, defende abordagem baseada em habilidades
Uma publicação no Reddit no r/openclaw critica a criação de agentes de IA com títulos de cargo como 'desenvolvedor backend' ou 'growth hacker' como uma sobrecarga desnecessária, propondo, em vez disso, empacotar habilidades como competências reutilizáveis que podem ser chamadas quando necessário.
Claude Code v2.1.246 Corrige Renderização de Diff, Interrupções MCP e Mais
Claude Code v2.1.246 corrige lentidão em transcrições causada por diffs de linha única longa, interrupções em chamadas de ferramentas MCP e adiciona uma aba Modo Auto em /permissions.

Análise das alegações de Jensen Huang sobre o GTC 2026 OpenClaw e da estratégia da Nvidia
Uma verificação de fatos das afirmações do CEO da Nvidia, Jensen Huang, na keynote do GTC 2026 sobre o crescimento do OpenClaw, riscos de segurança de agentes e as soluções proprietárias da Nvidia. A fonte verifica as alegações técnicas enquanto analisa o posicionamento de negócios da Nvidia.

Opus 4.7 Injeta-se a si mesmo e Vaza o Prompt do Sistema
Usuários do Claude Opus 4.7 relatam que o modelo está injetando prompts falsos do sistema e vazando partes dos prompts reais sem qualquer gatilho do usuário.