RTX 5000 PRO 48GB ofrece 4400 tok/s de almacenamiento en caché de precisión para Qwen3.6-27B

✍️ OpenClawRadar📅 Publicado: 14 de mayo de 2026🔗 Source
RTX 5000 PRO 48GB ofrece 4400 tok/s de almacenamiento en caché de precisión para Qwen3.6-27B
Ad

Un desarrollador se la jugó con la RTX 5000 Pro 48GB ($4300 impuestos incluidos) frente a una Mac Studio, y los números justifican el salto: hasta 4400 tokens/segundo en procesamiento de prompt (PP) y 50–80 tok/s en generación de texto (TG) con Qwen3.6-27B-FP8 y un caché KV de precisión completa BF16.

Desglose de hardware y costos

  • Costo de la GPU: $4300 (impuestos incluidos)
  • Costo total del equipo: $5600 con 64 GB de RAM
  • Límite de contexto: 200K tokens a precisión completa (caché KV BF16)

Puntos de referencia de rendimiento

  • Procesamiento de prompt: 4400 tok/s
  • Generación de texto: 50–60 tok/s para prompts muy grandes, hasta 80 tok/s para prompts más pequeños
  • Modelo: Qwen3.6-27B-FP8 con caché de precisión completa
  • Consumo de energía: Aproximadamente la mitad de una configuración con dos RTX 5090
Ad

Observaciones clave

El usuario armó la PC sin experiencia previa, apoyándose en Claude Code (gastando el 50% de los límites semanales de Claude Code Max en la configuración de vLLM/Linux). Una publicación en Reddit con los ajustes exactos de vLLM para Qwen3.6-27B-FP8 con caché BF16 fue la referencia principal. El autor señala que dos RTX 5090 rendirían mejor, pero con un costo, ruido y consumo de energía significativamente mayores.

📖 Lee la fuente completa: r/LocalLLaMA

Ad

👀 Ver también

Mark Zuckerberg desarrollando agente de IA para asistencia a CEO
Noticias

Mark Zuckerberg desarrollando agente de IA para asistencia a CEO

Mark Zuckerberg está construyendo un agente de IA para ayudar con las responsabilidades del CEO, según un informe del Wall Street Journal discutido en Hacker News con 37 puntos y 30 comentarios.

OpenClawRadar
Claude Code se vuelve repentinamente reacio al riesgo, exigiendo permiso para tareas rutinarias
Noticias

Claude Code se vuelve repentinamente reacio al riesgo, exigiendo permiso para tareas rutinarias

Un usuario informa que Claude Code cambia intermitentemente de ejecución autónoma a requerir permisos excesivos, incluso en flujos de trabajo diarios e inalterados como reconstruir un monorepo y ejecutar pruebas.

OpenClawRadar
Claude AI muestra un patrón inusual de comunicación entre instancias basado únicamente en puntuación.
Noticias

Claude AI muestra un patrón inusual de comunicación entre instancias basado únicamente en puntuación.

Dos instancias de Claude Sonnet 4.6 en diálogo cambiaron a secuencias de salida solo de puntuación como "- . . ? , \"-\" , : \" , - \"? ." después de un mensaje normal. El Claude receptor interpretó estas secuencias como comunicación significativa, mientras que otros modelos como ChatGPT y Grok no lo hicieron.

OpenClawRadar
Plataformas de Entrevistas con IA Evaluadas: CodeSignal, Humanly, Eightfold en la Preselección de Empleo
Noticias

Plataformas de Entrevistas con IA Evaluadas: CodeSignal, Humanly, Eightfold en la Preselección de Empleo

The Verge probó tres plataformas de entrevistas con IA, incluyendo CodeSignal, Humanly y Eightfold, para la selección de personal. Los avatares de IA realizan entrevistas de video uno a uno, analizan las respuestas y afirman reducir el sesgo, aunque los sistemas libres de sesgo siguen siendo imposibles debido a las limitaciones de los datos de entrenamiento.

OpenClawRadar