Usuário do Reddit relata 18,8 tok/s em inferência com CPU usando Qwen 3 30B Q4 em Zen 4

✍️ OpenClawRadar📅 Publicado: April 15, 2026🔗 Source
Usuário do Reddit relata 18,8 tok/s em inferência com CPU usando Qwen 3 30B Q4 em Zen 4
Ad

Um usuário do Reddit compartilhou sua experiência testando inferência de LLM local em CPU em vez de investir em hardware de GPU caro.

Detalhes Principais

O usuário estava considerando comprar hardware de GPU para inferência local de LLM, incluindo:

  • GPUs P40
  • GPUs V100 (quase comprou uma versão SXM2 que não conecta em placas-mãe normais)
  • RTX 3090s (com preço de US$ 800+ devido à demanda por IA)

Após ser aconselhado a tentar primeiro a inferência em CPU, ele testou:

  • Modelo: Qwen 3 30B Q4
  • Hardware: Processador Zen 4 com memória DDR5
  • Desempenho: 18,8 tokens por segundo em CPU
  • Expectativa vs Realidade: Esperava 3-5 tok/s, obteve quase 19 tok/s

O usuário observou que "Zen 4 + DDR5 é absurdo para inferência."

Ad

Resultados de Testes Práticos

O usuário conduziu uma comparação de tarefa real de programação:

  • Um modelo de 8B "escreveu código completamente errado com confiança"
  • O modelo de 30B "acertou de primeira"
  • Ele descreveu o desempenho do modelo de 30B como "basicamente nível GPT-4o por US$ 0"

Isso sugere que, para certas tarefas de programação, um modelo de 30B adequadamente quantizado rodando em hardware moderno de CPU pode fornecer resultados comparáveis a modelos maiores baseados em nuvem, sem o investimento em hardware tipicamente associado à inferência local de LLM.

📖 Leia a fonte completa: r/LocalLLaMA

Ad

👀 See Also

Benchmark Local LLM: Geração de Backend por Chamada de Função – Comparação entre GLM, Qwen e DeepSeek
News

Benchmark Local LLM: Geração de Backend por Chamada de Função – Comparação entre GLM, Qwen e DeepSeek

Um benchmark rigoroso de LLMs locais e de fronteira para geração de código backend via chamada de função, com rubrica de pontuação. Principais conclusões: qwen3.5-35b-a3b equivale ao gpt-5.4 em design de DB/API, e o denso Qwen 27B supera o 397B MoE. Modelos de fronteira foram removidos devido ao custo.

OpenClawRadar
Claude-Code v2.1.110 adiciona modo TUI, notificações push e várias correções
News

Claude-Code v2.1.110 adiciona modo TUI, notificações push e várias correções

A versão Claude-Code v2.1.110 introduz um novo comando /tui para renderização sem cintilação, recursos de notificação por push para alertas móveis e melhorias no gerenciamento de plugins e funcionalidade de controle remoto. A versão também inclui várias correções de bugs para servidores MCP, manipulação de sessões e problemas de interface do usuário.

OpenClawRadar
Claude Code Opus 4.6 Agora Usa por Padrão uma Janela de Contexto de 1 Milhão de Tokens
News

Claude Code Opus 4.6 Agora Usa por Padrão uma Janela de Contexto de 1 Milhão de Tokens

O modelo Opus 4.6 do Claude Code agora vem com uma janela de contexto de 1 milhão de tokens por padrão, mantendo o mesmo preço das versões anteriores. Essa mudança parece estar ativa sem um anúncio oficial.

OpenClawRadar
A startup de IA de Yann LeCun levanta US$ 1 bilhão na maior rodada de semente da Europa
News

A startup de IA de Yann LeCun levanta US$ 1 bilhão na maior rodada de semente da Europa

A startup de IA de Yann LeCun levantou US$ 1 bilhão no que é relatado como a maior rodada de seed da Europa. A notícia foi compartilhada no Hacker News com 186 pontos e 107 comentários.

OpenClawRadar