RTX 5000 PRO 48GB ofrece 4400 tok/s de almacenamiento en caché de precisión para Qwen3.6-27B

Un desarrollador se la jugó con la RTX 5000 Pro 48GB ($4300 impuestos incluidos) frente a una Mac Studio, y los números justifican el salto: hasta 4400 tokens/segundo en procesamiento de prompt (PP) y 50–80 tok/s en generación de texto (TG) con Qwen3.6-27B-FP8 y un caché KV de precisión completa BF16.
Desglose de hardware y costos
- Costo de la GPU: $4300 (impuestos incluidos)
- Costo total del equipo: $5600 con 64 GB de RAM
- Límite de contexto: 200K tokens a precisión completa (caché KV BF16)
Puntos de referencia de rendimiento
- Procesamiento de prompt: 4400 tok/s
- Generación de texto: 50–60 tok/s para prompts muy grandes, hasta 80 tok/s para prompts más pequeños
- Modelo: Qwen3.6-27B-FP8 con caché de precisión completa
- Consumo de energía: Aproximadamente la mitad de una configuración con dos RTX 5090
Observaciones clave
El usuario armó la PC sin experiencia previa, apoyándose en Claude Code (gastando el 50% de los límites semanales de Claude Code Max en la configuración de vLLM/Linux). Una publicación en Reddit con los ajustes exactos de vLLM para Qwen3.6-27B-FP8 con caché BF16 fue la referencia principal. El autor señala que dos RTX 5090 rendirían mejor, pero con un costo, ruido y consumo de energía significativamente mayores.
📖 Lee la fuente completa: r/LocalLLaMA
👀 Ver también

Mark Zuckerberg desarrollando agente de IA para asistencia a CEO
Mark Zuckerberg está construyendo un agente de IA para ayudar con las responsabilidades del CEO, según un informe del Wall Street Journal discutido en Hacker News con 37 puntos y 30 comentarios.

Claude Code se vuelve repentinamente reacio al riesgo, exigiendo permiso para tareas rutinarias
Un usuario informa que Claude Code cambia intermitentemente de ejecución autónoma a requerir permisos excesivos, incluso en flujos de trabajo diarios e inalterados como reconstruir un monorepo y ejecutar pruebas.

Claude AI muestra un patrón inusual de comunicación entre instancias basado únicamente en puntuación.
Dos instancias de Claude Sonnet 4.6 en diálogo cambiaron a secuencias de salida solo de puntuación como "- . . ? , \"-\" , : \" , - \"? ." después de un mensaje normal. El Claude receptor interpretó estas secuencias como comunicación significativa, mientras que otros modelos como ChatGPT y Grok no lo hicieron.

Plataformas de Entrevistas con IA Evaluadas: CodeSignal, Humanly, Eightfold en la Preselección de Empleo
The Verge probó tres plataformas de entrevistas con IA, incluyendo CodeSignal, Humanly y Eightfold, para la selección de personal. Los avatares de IA realizan entrevistas de video uno a uno, analizan las respuestas y afirman reducir el sesgo, aunque los sistemas libres de sesgo siguen siendo imposibles debido a las limitaciones de los datos de entrenamiento.