Usuario de Reddit informa 18.8 tok/s en inferencia por CPU con Qwen 3 30B Q4 en Zen 4.

✍️ OpenClawRadar📅 Publicado: 15 de abril de 2026🔗 Source
Usuario de Reddit informa 18.8 tok/s en inferencia por CPU con Qwen 3 30B Q4 en Zen 4.
Ad

Un usuario de Reddit compartió su experiencia probando la inferencia de LLM local en CPU en lugar de invertir en costoso hardware de GPU.

Detalles Clave

El usuario estaba considerando comprar hardware de GPU para inferencia local de LLM, incluyendo:

  • GPUs P40
  • GPUs V100 (casi compró una versión SXM2 que no se conecta a placas madre normales)
  • RTX 3090 (con precios de $800+ debido a la demanda de IA)

Después de que le aconsejaron probar primero la inferencia en CPU, probó:

  • Modelo: Qwen 3 30B Q4
  • Hardware: Procesador Zen 4 con memoria DDR5
  • Rendimiento: 18.8 tokens por segundo en CPU
  • Expectativa vs Realidad: Esperaba 3-5 tok/s, obtuvo casi 19 tok/s

El usuario señaló que "Zen 4 + DDR5 es increíble para inferencia".

Ad

Resultados de Pruebas Prácticas

El usuario realizó una comparación de tareas de programación reales:

  • Un modelo de 8B "escribió código completamente incorrecto con confianza"
  • El modelo de 30B "lo hizo perfecto al primer intento"
  • Describieron el rendimiento del modelo de 30B como "básicamente nivel GPT-4o por $0"

Esto sugiere que para ciertas tareas de programación, un modelo de 30B correctamente cuantizado ejecutándose en hardware moderno de CPU puede proporcionar resultados comparables a modelos más grandes basados en la nube, sin la inversión en hardware típicamente asociada con la inferencia local de LLM.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Ver también

Etiquetas Automáticas de YouTube para Videos de IA: Etiquetas Simplificadas y Detección Automática en 2026
Noticias

Etiquetas Automáticas de YouTube para Videos de IA: Etiquetas Simplificadas y Detección Automática en 2026

YouTube actualiza las etiquetas de IA: ubicación más destacada, detección automática de contenido fotorrealista y etiquetas permanentes para videos creados con las herramientas propias de YouTube o metadatos C2PA.

OpenClawRadar
🦀
Noticias

Los gobiernos apuestan fuerte por la IA — The Economist advierte de los riesgos

The Economist sostiene que los gobiernos están haciendo una apuesta peligrosa con el auge de la IA, arriesgando escollos económicos y de seguridad. Preocupaciones clave: dependencia excesiva de los gigantes tecnológicos, regulación apresurada y posible desplazamiento laboral.

OpenClawRadar
Anthropic pausa cambio de crédito para Claude Code: Agent SDK sigue en suscripción
Noticias

Anthropic pausa cambio de crédito para Claude Code: Agent SDK sigue en suscripción

Anthropic detiene el cambio planeado de mover el SDK de Agent, claude -p y aplicaciones de terceros a un crédito mensual dedicado. El uso continúa bajo los límites de suscripción existentes.

OpenClawRadar
La actualización del 15 de junio de Claude rompe la solución alternativa para agentes sin interfaz — Las sesiones interactivas aún funcionan en tu plan
Noticias

La actualización del 15 de junio de Claude rompe la solución alternativa para agentes sin interfaz — Las sesiones interactivas aún funcionan en tu plan

La actualización del 15 de junio de Claude mide el uso sin cabeza (claude -p, Agent SDK) en un pool de créditos. Las sesiones interactivas de Claude Code aún se facturan según tu plan de tarifa plana: esto es lo que necesitas saber.

OpenClawRadar