Referência: Gemma4 12B vs Qwen3 8B quantizado em Mac Mini de 24GB

✍️ OpenClawRadar📅 Publicado: April 21, 2026🔗 Source
Referência: Gemma4 12B vs Qwen3 8B quantizado em Mac Mini de 24GB
Ad

Comparação de desempenho de dois modelos locais para OpenClaw

Um desenvolvedor realizou um teste direto comparando o Gemma4 12B e o Qwen3:8b-q4_K_M em um Mac Mini de 24GB. O teste usou dois prompts: "explique como funciona um carburador" e "escreva uma função Python para detectar vazamentos de memória". O Claude ajudou a escrever um comando para filtrar a saída com grep para medição.

Resultados do benchmark

Tarefa de explicação do carburador:

  • Qwen3:8b-q4_K_M: Avaliação do prompt: 89,8 t/s, Geração: 19,6 t/s
  • Gemma4: Avaliação do prompt: 20,8 t/s, Geração: 27,6 t/s

Tarefa de codificação Python:

  • Qwen3:8b-q4_K_M: Avaliação do prompt: 133,8 t/s, Geração: 18,7 t/s
  • Gemma4: Avaliação do prompt: 26,1 t/s, Geração: 26,1 t/s
Ad

Principais conclusões

O Qwen3 processa prompts 4-5x mais rápido que o Gemma4, o que é importante para o OpenClaw devido aos prompts de contexto grandes normalmente enviados. O Gemma4 gera a saída um pouco mais rápido. Para muitos usos do OpenClaw, o Qwen3 vence em velocidade. O desenvolvedor observa que o Gemma4 é um modelo de 12B e pode produzir uma saída ligeiramente melhor, embora isso não tenha sido testado.

O desenvolvedor executa várias tarefas em modelos locais, incluindo trabalhos cron, monitoramento de heartbeat, indexação de memória, e frequentemente faz o OpenClaw chamar subagentes executando modelos locais. Eles estão testando o Gemma4 como o modelo local para todas essas tarefas em segundo plano, mas não esperam notar diferenças de desempenho, já que estas rodam em segundo plano.

📖 Read the full source: r/openclaw

Ad

👀 See Also

HolyCode: Contêiner Docker para Ambientes de Codificação Persistente da Claude AI
Tools

HolyCode: Contêiner Docker para Ambientes de Codificação Persistente da Claude AI

HolyCode é um contêiner Docker que mantém o estado do ambiente de codificação com IA entre trocas de máquinas e reconstruções. Inclui mais de 30 ferramentas pré-instaladas, automação de navegador com Chromium + xvfb + Playwright, e preserva o contexto em ./data/opencode.

OpenClawRadar
Tokens do Repositório: Ação do GitHub Adiciona Emblema de Contagem de Tokens para Consciência da Janela de Contexto de LLM
Tools

Tokens do Repositório: Ação do GitHub Adiciona Emblema de Contagem de Tokens para Consciência da Janela de Contexto de LLM

Repo Tokens é uma GitHub Action que conta o tamanho da sua base de código em tokens usando tiktoken e exibe um emblema no seu README mostrando qual porcentagem da janela de contexto de um LLM ela preenche. O emblema usa verde para menos de 30%, amarelo para 50-70% e vermelho para 70%+.

OpenClawRadar
Apresentando o operate.txt: Uma especificação YAML para agentes de IA que navegam por produtos SaaS
Tools

Apresentando o operate.txt: Uma especificação YAML para agentes de IA que navegam por produtos SaaS

Um desenvolvedor criou operate.txt, um arquivo YAML hospedado em yourdomain.com/operate.txt que documenta detalhes da tela, estados de carregamento, ações irreversíveis e caminhos passo a passo para agentes de IA usando recursos de uso do computador. A especificação aborda problemas como o Claude perguntar 'isso está quebrado?' durante telas de carregamento legítimas.

OpenClawRadar
DGX Sparks Duplo vs Mac Studio M3 Ultra: Comparação Prática para Executar o Qwen3.5 397B Localmente
Tools

DGX Sparks Duplo vs Mac Studio M3 Ultra: Comparação Prática para Executar o Qwen3.5 397B Localmente

Um desenvolvedor comparou a execução local do Qwen3.5 397B em um Mac Studio M3 Ultra 512GB de US$ 10 mil e uma configuração dual DGX Spark de US$ 10 mil. O Mac Studio alcançou 30-40 tok/s com largura de banda de 800 GB/s, mas pré-preenchimento lento, enquanto os Sparks entregaram 27-28 tok/s com computação mais rápida, porém configuração complexa.

OpenClawRadar