Os modelos Bonsai 1-bit Qwen da PrismML testados: 107 t/s de geração em 8GB de VRAM

Modelos Bonsai: Quantização de 1 bit do Qwen da PrismML
A PrismML lançou o Bonsai, um conjunto de versões quantizadas de 1 bit dos modelos Qwen3 (8B, 4B e 1.7B parâmetros). Esses modelos usam quantização extrema para reduzir drasticamente os requisitos de memória, mantendo um desempenho utilizável para certas tarefas.
Benchmarks de desempenho dos testes
Testes em uma RTX 4060 com 8GB de VRAM mostraram:
- Velocidade de geração de 107 tokens/segundo
- >1114 tokens/segundo no processamento de prompts
- Uso de RAM significativamente menor em comparação com modelos quantizados Q4
Para comparação, o Qwen 3.5 4B Q4 alcançou 56 t/s usando os mesmos prompts no mesmo hardware.
Implicações práticas
A pegada de memória reduzida permite executar modelos de 8B parâmetros em sistemas com 8GB de VRAM. Modelos menores podem ser usados com janelas de contexto mais longas devido à economia de memória.
Avaliação de qualidade
Os testes iniciais focaram na sumarização de texto, onde o modelo teve bom desempenho. O testador observou que não avaliou capacidades de codificação ou uso de ferramentas.
Limitações técnicas
A implementação atual tem problemas de inferência na CPU. Quando testado em um mini PC sem GPU:
- O fork do llama.cpp compila com sucesso
- O modelo carrega, mas trava durante o processamento do prompt
- A análise sugere que não existe implementação para CPU - provavelmente desquantiza para FP32 e tenta inferência regular, o que seria extremamente lento na CPU
Potencial técnico
Modelos de 1 bit poderiam reduzir não apenas os requisitos de largura de banda e memória, mas também os requisitos de computação. A multiplicação de matrizes em matrizes de 1 bit poderia usar operações XOR, que são muito mais rápidas do que operações de ponto flutuante. Mesmo com escalonamento para FP16 após as operações XOR, economias significativas de computação devem ser possíveis, potencialmente beneficiando cenários de inferência apenas com CPU e computação de borda.
Detalhes de configuração
O testador baixou:
- O modelo Bonsai 8B
- O fork do llama.cpp da PrismML
- Testado no Windows com CUDA
📖 Leia a fonte completa: r/LocalLLaMA
👀 See Also

Gemini Embedding 2: O Primeiro Modelo de Embedding Nativamente Multimodal da Google Lançado
O Google lançou o Gemini Embedding 2, seu primeiro modelo de embedding nativamente multimodal que mapeia texto, imagens, vídeo, áudio e documentos em um único espaço de embedding. O modelo suporta até 8192 tokens de texto, 6 imagens por solicitação, 120 segundos de vídeo e PDFs de até 6 páginas, com dimensões de saída flexíveis de 3072 até 768.

Domo CDO: Pare o FOMO de IA, Comece com Planilhas
O diretor de design da Domo, Chris Willis, argumenta que a IA está sendo vendida sem especificações, criando um teatro de 'tokenmaxxing' baseado no medo. Sua solução: comece automatizando um processo de planilha, não perseguindo metas mirabolantes.

Anthropic Lança Canais Claude Code para Integração de Mensagens
A Anthropic lançou os Claude Code Channels, permitindo que desenvolvedores enviem mensagens diretas para sessões do Claude Code a partir do Telegram ou Discord com acesso completo a ferramentas, incluindo edição de arquivos, execução de testes e operações git. O recurso requer um plano pago da Anthropic e suporta duas plataformas em comparação com as 20+ do OpenClaw.

Atualização de Status do Claude: Taxas de Erro Elevadas para Opus 4.6 e Sonnet 4.6
Um relatório oficial de status do sistema Claude informa taxas de erro elevadas para os modelos Opus 4.6 e Sonnet 4.6, com um incidente registrado em 2026-03-31T21:10:28.000Z. A publicação automática orienta os usuários a verificar o status de resolução e os relatórios de desempenho da comunidade.