Bonsai 27B: Primeiro modelo da classe 27B é executado em um smartphone — Pontuações de benchmark e especificações

A PrismML lançou o Bonsai 27B, o primeiro modelo da classe de 27 bilhões de parâmetros que cabe e funciona em um celular. Baseado no Qwen 3.6 27B, ele usa quantização extrema de baixa precisão — pesos ternários ou binários — para reduzir o modelo para 3,9 GB (variante 1-bit) ou 5,9 GB (variante ternária), em comparação com 54 GB em precisão de 16 bits.
Duas Variantes: Ternária vs 1-bit
- Bonsai 27B Ternário: pesos em {−1, 0, +1} com escala de grupo FP16, 1,71 bits efetivos por peso. Tamanho: 5,9 GB. Focado em laptops com raciocínio completo, chamada de ferramentas e capacidade agentiva.
- Bonsai 27B 1-bit: pesos binários {−1, +1}, 1,125 bits efetivos por peso. Tamanho: 3,9 GB. Cabe no orçamento de memória do iPhone 17 Pro.
Ambas as variantes executam toda a rede (embeddings, atenção, MLPs, cabeça LM) em baixa precisão — sem escapes de alta precisão. Elas suportam contexto de 262 mil tokens, visão multimodal (torre de visão 4-bit) e decodificação especulativa.
Pontuações em Benchmarks (modo de raciocínio)
Em uma suíte de 15 benchmarks:
- Matemática (GSM8K, MATH-500, AIME25, AIME26): Qwen 3.6 27B 95,3, Ternário 93,4, 1-bit 91,7
- Programação (HumanEval+, MBPP+, LiveCodeBench): 88,7 → 86,0 → 81,9
- Agentivo/Chamada de ferramentas (BFCL v3, TauBench): 80,0 → 74,0 → 66,0
- Segue instruções (IFEval, IFBench): 78,4 → 71,8 → 65,8
- Conhecimento/STEM (MMLU-Redux, MuSR): 83,1 → 77,0 → 73,4
- Visão (MMMU Pro, OCRBench): 72,6 → 65,2 → 59,6
- Geral: 85,0 → 80,5 (95% de retenção) → 76,1 (90% de retenção)
Matemática e programação são as menos afetadas — essenciais para cargas de trabalho agentivas. A variante 1-bit com 3,9 GB é menor que um modelo 2B em precisão total, mas oferece inteligência de classe 27B.
Por que a Execução Local é Importante para Agentes
Cargas de trabalho agentivas exigem muitas chamadas sequenciais de modelo — cada uma carregando contexto e produzindo saída estruturada. A execução apenas na nuvem significa latência por etapa, custos acumulativos de tokens e envio de dados privados (capturas de tela, arquivos) pela rede. Executar localmente elimina essas limitações. O Bonsai 27B possibilita raciocínio multi-etapas, chamadas de ferramentas e loops agentivos de uso de computador no dispositivo.
Licenciamento e Disponibilidade
Ambas as variantes estão disponíveis hoje sob a Licença Apache 2.0.
📖 Leia a fonte completa: HN AI Agents
👀 See Also

Desenvolvedor muda para Minimax 2.7 após banimento do Claude e problemas de crédito do MiMo
Um desenvolvedor testou vários modelos de IA para o OpenClaw após o banimento do Claude, descobrindo que o GLM 5.1 e o 5 Turbo eram ineficazes para tarefas de agente, o sistema de créditos do MiMo V2 Pro era ineficiente, e optou pelo Minimax 2.7 por sua cota generosa e capacidade de lidar com tarefas de automação.

O parâmetro effort=low do Claude Opus 4.6 difere dos modos de baixo raciocínio de outros provedores
O parâmetro effort=low do Claude Opus 4.6 controla o esforço comportamental geral, não apenas a profundidade do raciocínio, diferentemente do reasoning.effort=low da OpenAI ou do thinking_level=low do Gemini. Isso fez com que os agentes fizessem menos chamadas de ferramentas, fossem menos minuciosos na verificação cruzada e ignorassem partes das instruções do sistema sobre pesquisa na web.

Anthropic usa o Google Forms para feedback do Claude
Anthropic, a empresa por trás do Claude, usa um Google Forms de 2008 para coletar feedback de design em vez de criar uma ferramenta personalizada—destacando uma filosofia pragmática de construir vs. comprar.

Claude Code v2.1.169: Modo Seguro, Comando /cd e Dezenas de Correções de Bugs
A v2.1.169 adiciona --safe-mode para desabilitar todas as personalizações para solução de problemas, um comando /cd para mudar de diretório no meio da sessão sem perda de cache e corrige travamento de ~30-50ms na interface, congelamento da área de transferência no Windows e lacunas na aplicação de políticas MCP empresariais.