RTX 5000 PRO 48GB Fornece Cache de Precisão de 4400 tok/s para Qwen3.6-27B

Um desenvolvedor apostou na RTX 5000 Pro 48GB ($4300 com impostos) contra um Mac Studio — e os números justificam o salto: até 4400 tokens/segundo em processamento de prompt (PP) e 50–80 tok/s em geração de texto (TG) com Qwen3.6-27B-FP8 e cache KV BF16 de precisão total.
Detalhamento de Hardware e Custo
- Custo da GPU: $4300 (com impostos)
- Custo total da montagem: $5600 com 64GB de RAM
- Limite de contexto: 200K tokens em precisão total (cache KV BF16)
Benchmarks de Desempenho
- Processamento de prompt: 4400 tok/s
- Geração de texto: 50–60 tok/s para prompts muito grandes, até 80 tok/s para menores
- Modelo: Qwen3.6-27B-FP8 com cache de precisão total
- Consumo de energia: Aproximadamente metade de uma configuração com duas RTX 5090
Observações Principais
O usuário montou o PC do zero, sem experiência, contando com o Claude Code (consumindo 50% dos limites semanais do Claude Code Max na configuração do vLLM/Linux). Um post no Reddit detalhando as configurações exatas do vLLM para Qwen3.6-27B-FP8 com cache BF16 foi a referência principal. O autor observa que duas RTX 5090 teriam desempenho superior, mas com custo, ruído e consumo de energia significativamente maiores.
📖 Leia a fonte completa: r/LocalLLaMA
👀 See Also

A História do OpenClaw: Do Moltbot à Revolução da IA de Código Aberto
Nenhum

Gemini 3.1 Flash Live: o mais recente modelo de áudio do Google com benchmarks aprimorados e marca d'água
O Google lançou o Gemini 3.1 Flash Live, um modelo de áudio que obteve 90,8% no ComplexFuncBench Audio e 36,1% no Audio MultiChallenge da Scale AI. Ele está disponível via Gemini Live API no Google AI Studio e inclui marca d'água SynthID.

Após o incidente com a Anthropic, Pentágono promete não mais depender de um único fornecedor de IA e firma acordos com AWS, Google, Microsoft, NVIDIA, OpenAI, Oracle e SpaceX.
O subsecretário de Defesa Emil Michael afirma que o Pentágono 'nunca mais' dependerá de um único provedor de modelos de IA, citando a complexidade da integração e a recente disputa com a Anthropic. Novos acordos com oito empresas de IA visam diversificar a pilha tecnológica.

Novo Lançamento da OpenClaw: Uma Simples Mudança de Nome ou uma Grande Atualização?
O OpenClaw, anteriormente conhecido como ClawDBot, passou por uma transformação. Continue lendo para descobrir se essa mudança é apenas cosmética ou se introduz novos recursos e estabilidade aprimorada.