Bonsai 2 (Qwen 3.8 27B) como fallback do OpenClaw: 8 GB, 85 tok/s numa 5070
O Ternary-Bonsai-2-27B da PrismML é uma build quantizada do Qwen3 3.8 27B que um usuário do r/openclaw está rodando localmente como modelo de fallback no OpenClaw quando suas cotas do ChatGPT e do Grok acabam. A alegação dele: ~8GB de footprint, 98% da qualidade do Qwen3 27B base retida, e suporte a texto e visão.
Números da configuração
- Velocidade de saída: 85 tok/s
- Hardware: RTX 5070 com 16GB de VRAM, 64GB de memória do sistema
- Footprint em disco: ~8GB
- Retenção de qualidade: 98% do Qwen3 3.8 27B, segundo o relato
Os dois GGUFs que você precisa
Os arquivos vêm do repositório prism-ml/Ternary-Bonsai-2-27B-gguf no Hugging Face:
Ternary-Bonsai-2-27B-PQ2_0.gguf (texto) Ternary-Bonsai-2-27B-mmproj-Q8_0.gguf (visão)
Os dois são necessários se você quiser o caminho multimodal — o arquivo mmproj é o projetor de visão, o arquivo PQ2_0 são os pesos de texto ternarizados.
Notas de configuração
O Bonsai 2 exige o fork próprio do llama.cpp da PrismML — ele não carrega no llama.cpp padrão. O autor fez o GPT montar o fork numa máquina de IA separada do host do OpenClaw, com o modelo configurado para:
- Carregar dinamicamente quando o OpenClaw o chama
- Descarregar após 10 minutos de inatividade
- Atuar como fallback quando o GPT 5.6 e o Grok atingem os limites de uso
O que ele realmente fez
A parte interessante não é o tok/s — é o comportamento agêntico. Segundo o post, ele lidou com busca na web via navegador, controle de VM, instalação e uso de novos softwares, e execução de fluxos de trabalho existentes, a ponto de o autor dizer que "não dá para perceber que não é um modelo de ponta".
Isso é o relato de um único usuário, não um benchmark, então trate as alegações de qualidade como anedóticas. O padrão de carregar/descarregar na ociosidade é o aprendizado prático: ele mantém um 27B local residente só quando seu provedor pago está com limite de taxa, o que é uma forma sensata de evitar queimar VRAM permanentemente numa máquina que também faz outros trabalhos.
Se você tem uma GPU com 16GB+ de VRAM, o par PQ2_0 + mmproj é pequeno o suficiente para valer a pena testar contra suas próprias tarefas agênticas antes de decidir se ele aguenta o tranco para você.
📖 Read the full source: r/openclaw
👀 See Also

ClaudeClaw: Plugin de Código Gratuito do Claude para Agentes de IA Persistente em Plataformas de Mensagens
ClaudeClaw é um plugin gratuito e de código aberto para Claude Code, licenciado pelo MIT, que executa o Claude como um agente persistente no Slack, WhatsApp e Telegram. Requer Node.js 20+, Claude Code e sua própria chave de API da Anthropic, com isolamento em nível de sistema operacional via sandbox-runtime da Anthropic.

Smriti: Um sistema semelhante ao Git para gerenciar o estado de raciocínio de LLM e evitar a deriva na conversa
Smriti é uma ferramenta de código aberto que permite aos desenvolvedores salvar, restaurar, ramificar e comparar estados de raciocínio em conversas com LLMs para evitar desvios. Ela trata as interações como estado, em vez de histórico de conversa, permitindo retornos limpos e exploração alternativa sem contaminação.

Clawforce: Plano de Controle de Código Aberto para Gerenciar Equipes de Agentes Clawbot
Clawforce é um plano de controle de código aberto para gerenciar equipes de agentes Clawbot que permite implantação com alguns cliques. Ele fornece configuração de personagens, habilidades, integrações MCP e ferramentas através de uma interface, com agentes capazes de planejar, coordenar e executar tarefas de forma colaborativa.

LORE.md: Um Padrão Aberto para Extrair Conhecimento Estruturado de Conversas com IA
LORE.md é um padrão aberto para extrair conhecimento duradouro de conversas com IA em um formato estruturado. Ele captura decisões com justificativa, insights, padrões, questões em aberto e próximos passos, com tudo interligado entre sessões.