RTX 5000 PRO 48GB Fornece Cache de Precisão de 4400 tok/s para Qwen3.6-27B

Um desenvolvedor apostou na RTX 5000 Pro 48GB ($4300 com impostos) contra um Mac Studio — e os números justificam o salto: até 4400 tokens/segundo em processamento de prompt (PP) e 50–80 tok/s em geração de texto (TG) com Qwen3.6-27B-FP8 e cache KV BF16 de precisão total.
Detalhamento de Hardware e Custo
- Custo da GPU: $4300 (com impostos)
- Custo total da montagem: $5600 com 64GB de RAM
- Limite de contexto: 200K tokens em precisão total (cache KV BF16)
Benchmarks de Desempenho
- Processamento de prompt: 4400 tok/s
- Geração de texto: 50–60 tok/s para prompts muito grandes, até 80 tok/s para menores
- Modelo: Qwen3.6-27B-FP8 com cache de precisão total
- Consumo de energia: Aproximadamente metade de uma configuração com duas RTX 5090
Observações Principais
O usuário montou o PC do zero, sem experiência, contando com o Claude Code (consumindo 50% dos limites semanais do Claude Code Max na configuração do vLLM/Linux). Um post no Reddit detalhando as configurações exatas do vLLM para Qwen3.6-27B-FP8 com cache BF16 foi a referência principal. O autor observa que duas RTX 5090 teriam desempenho superior, mas com custo, ruído e consumo de energia significativamente maiores.
📖 Leia a fonte completa: r/LocalLLaMA
👀 See Also

Projeto SDL Proíbe Commits Escritos por IA em Resposta a Problema no GitHub
O projeto SDL implementou uma política que proíbe commits gerados por IA após uma issue no GitHub levantar preocupações sobre o uso do Copilot em revisões de código. A issue menciona especificamente as revisões #13277 e #12730 como exemplos onde foi detectada assistência de IA.

Atualizações do Claude Code Engineer: Pergunta ao Usuário em Markdown, Ganchos HTTP, Novas Habilidades
Claude Code Engineer lançou três atualizações: a ferramenta AskUserQuestion agora suporta snippets de markdown para diagramas e exemplos de código, um novo manipulador de hook HTTP permite que hooks postem em endpoints HTTP, e duas novas habilidades foram adicionadas.

Estado do Open Source AI da Mozilla: 3% de diferença de desempenho, redução de 50x nos custos, adoção por 79% dos desenvolvedores
O primeiro relatório State of Open Source AI da Mozilla revela que os modelos abertos agora ficam apenas 3% atrás dos sistemas fechados em desempenho, custam até 50x menos e são usados por 79% dos desenvolvedores — mas capturam apenas 4% da receita.

A SDK do Agente vs Claude CLI: A perspectiva do usuário sobre a diferença prática
Um usuário do Reddit questiona a diferença prática entre o novo SDK de Agente para Claude e o uso do Claude CLI para conectar o Opus 4.7 localmente.