Usuário do Reddit relata 18,8 tok/s em inferência com CPU usando Qwen 3 30B Q4 em Zen 4

✍️ OpenClawRadar📅 Publicado: April 15, 2026🔗 Source
Usuário do Reddit relata 18,8 tok/s em inferência com CPU usando Qwen 3 30B Q4 em Zen 4
Ad

Um usuário do Reddit compartilhou sua experiência testando inferência de LLM local em CPU em vez de investir em hardware de GPU caro.

Detalhes Principais

O usuário estava considerando comprar hardware de GPU para inferência local de LLM, incluindo:

  • GPUs P40
  • GPUs V100 (quase comprou uma versão SXM2 que não conecta em placas-mãe normais)
  • RTX 3090s (com preço de US$ 800+ devido à demanda por IA)

Após ser aconselhado a tentar primeiro a inferência em CPU, ele testou:

  • Modelo: Qwen 3 30B Q4
  • Hardware: Processador Zen 4 com memória DDR5
  • Desempenho: 18,8 tokens por segundo em CPU
  • Expectativa vs Realidade: Esperava 3-5 tok/s, obteve quase 19 tok/s

O usuário observou que "Zen 4 + DDR5 é absurdo para inferência."

Ad

Resultados de Testes Práticos

O usuário conduziu uma comparação de tarefa real de programação:

  • Um modelo de 8B "escreveu código completamente errado com confiança"
  • O modelo de 30B "acertou de primeira"
  • Ele descreveu o desempenho do modelo de 30B como "basicamente nível GPT-4o por US$ 0"

Isso sugere que, para certas tarefas de programação, um modelo de 30B adequadamente quantizado rodando em hardware moderno de CPU pode fornecer resultados comparáveis a modelos maiores baseados em nuvem, sem o investimento em hardware tipicamente associado à inferência local de LLM.

📖 Leia a fonte completa: r/LocalLLaMA

Ad

👀 See Also

Claude AI apresenta atualizações do plugin Cowork com personalização empresarial e novos conectores
News

Claude AI apresenta atualizações do plugin Cowork com personalização empresarial e novos conectores

A Claude AI lançou atualizações do plugin Cowork que permitem aos administradores empresariais criar marketplaces de plugins privados e adicionar conectores para Google Workspace, Docusign, Apollo e outras ferramentas. Uma nova prévia de pesquisa permite que o Claude trabalhe entre Excel e PowerPoint para análise de ponta a ponta e criação de apresentações.

OpenClawRadar
Debate MCP vs Habilidades: Entendendo os Papéis e o Verdadeiro Problema da Degradação de Contexto
News

Debate MCP vs Habilidades: Entendendo os Papéis e o Verdadeiro Problema da Degradação de Contexto

Uma postagem no Reddit esclarece que o MCP fornece ferramentas, autenticação e direcionamento de contexto para agentes de IA, enquanto Skills são prompts reutilizáveis que definem o comportamento do agente. O autor argumenta que ambos são necessários e identifica a deterioração do contexto como um problema crítico em que os agentes esquecem instruções.

OpenClawRadar
Local Qwen 3.6 vs Modelos de Fronteira em um Primitivo de Codificação: Animação de Condução em Canvas HTML de Arquivo Único
News

Local Qwen 3.6 vs Modelos de Fronteira em um Primitivo de Codificação: Animação de Condução em Canvas HTML de Arquivo Único

Um usuário do Reddit comparou quantizações locais do Qwen 3.6 com modelos de fronteira (Claude, Gemini, GPT, Kimi) em uma tarefa densa de animação de direção em canvas HTML em arquivo único. O Qwen 3.6-27B Q4_K_M local entregou movimento e camadas mais naturais do que algumas saídas de fronteira.

OpenClawRadar
🦀
News

Medindo a Desleixo do Código: Métricas de Verbosidade e Erosão

Os LLMs são quase perfeitos na geração de código correto, mas a correção não significa que o código esteja livre de duplicação, abstrações desnecessárias ou inchaço. Duas métricas do SlopCodeBench, verbosidade e erosão, ajudam a quantificar a desleixo do código.

OpenClawRadar