RTX 5000 PRO 48GB Fornece Cache de Precisão de 4400 tok/s para Qwen3.6-27B

✍️ OpenClawRadar📅 Publicado: May 14, 2026🔗 Source
RTX 5000 PRO 48GB Fornece Cache de Precisão de 4400 tok/s para Qwen3.6-27B
Ad

Um desenvolvedor apostou na RTX 5000 Pro 48GB ($4300 com impostos) contra um Mac Studio — e os números justificam o salto: até 4400 tokens/segundo em processamento de prompt (PP) e 50–80 tok/s em geração de texto (TG) com Qwen3.6-27B-FP8 e cache KV BF16 de precisão total.

Detalhamento de Hardware e Custo

  • Custo da GPU: $4300 (com impostos)
  • Custo total da montagem: $5600 com 64GB de RAM
  • Limite de contexto: 200K tokens em precisão total (cache KV BF16)

Benchmarks de Desempenho

  • Processamento de prompt: 4400 tok/s
  • Geração de texto: 50–60 tok/s para prompts muito grandes, até 80 tok/s para menores
  • Modelo: Qwen3.6-27B-FP8 com cache de precisão total
  • Consumo de energia: Aproximadamente metade de uma configuração com duas RTX 5090
Ad

Observações Principais

O usuário montou o PC do zero, sem experiência, contando com o Claude Code (consumindo 50% dos limites semanais do Claude Code Max na configuração do vLLM/Linux). Um post no Reddit detalhando as configurações exatas do vLLM para Qwen3.6-27B-FP8 com cache BF16 foi a referência principal. O autor observa que duas RTX 5090 teriam desempenho superior, mas com custo, ruído e consumo de energia significativamente maiores.

📖 Leia a fonte completa: r/LocalLLaMA

Ad

👀 See Also

Projeto SDL Proíbe Commits Escritos por IA em Resposta a Problema no GitHub
News

Projeto SDL Proíbe Commits Escritos por IA em Resposta a Problema no GitHub

O projeto SDL implementou uma política que proíbe commits gerados por IA após uma issue no GitHub levantar preocupações sobre o uso do Copilot em revisões de código. A issue menciona especificamente as revisões #13277 e #12730 como exemplos onde foi detectada assistência de IA.

OpenClawRadar
Atualizações do Claude Code Engineer: Pergunta ao Usuário em Markdown, Ganchos HTTP, Novas Habilidades
News

Atualizações do Claude Code Engineer: Pergunta ao Usuário em Markdown, Ganchos HTTP, Novas Habilidades

Claude Code Engineer lançou três atualizações: a ferramenta AskUserQuestion agora suporta snippets de markdown para diagramas e exemplos de código, um novo manipulador de hook HTTP permite que hooks postem em endpoints HTTP, e duas novas habilidades foram adicionadas.

OpenClawRadar
Estado do Open Source AI da Mozilla: 3% de diferença de desempenho, redução de 50x nos custos, adoção por 79% dos desenvolvedores
News

Estado do Open Source AI da Mozilla: 3% de diferença de desempenho, redução de 50x nos custos, adoção por 79% dos desenvolvedores

O primeiro relatório State of Open Source AI da Mozilla revela que os modelos abertos agora ficam apenas 3% atrás dos sistemas fechados em desempenho, custam até 50x menos e são usados por 79% dos desenvolvedores — mas capturam apenas 4% da receita.

OpenClawRadar
A SDK do Agente vs Claude CLI: A perspectiva do usuário sobre a diferença prática
News

A SDK do Agente vs Claude CLI: A perspectiva do usuário sobre a diferença prática

Um usuário do Reddit questiona a diferença prática entre o novo SDK de Agente para Claude e o uso do Claude CLI para conectar o Opus 4.7 localmente.

OpenClawRadar