Usuario de Reddit informa 18.8 tok/s en inferencia por CPU con Qwen 3 30B Q4 en Zen 4.

✍️ OpenClawRadar📅 Publicado: 15 de abril de 2026🔗 Source
Usuario de Reddit informa 18.8 tok/s en inferencia por CPU con Qwen 3 30B Q4 en Zen 4.
Ad

Un usuario de Reddit compartió su experiencia probando la inferencia de LLM local en CPU en lugar de invertir en costoso hardware de GPU.

Detalles Clave

El usuario estaba considerando comprar hardware de GPU para inferencia local de LLM, incluyendo:

  • GPUs P40
  • GPUs V100 (casi compró una versión SXM2 que no se conecta a placas madre normales)
  • RTX 3090 (con precios de $800+ debido a la demanda de IA)

Después de que le aconsejaron probar primero la inferencia en CPU, probó:

  • Modelo: Qwen 3 30B Q4
  • Hardware: Procesador Zen 4 con memoria DDR5
  • Rendimiento: 18.8 tokens por segundo en CPU
  • Expectativa vs Realidad: Esperaba 3-5 tok/s, obtuvo casi 19 tok/s

El usuario señaló que "Zen 4 + DDR5 es increíble para inferencia".

Ad

Resultados de Pruebas Prácticas

El usuario realizó una comparación de tareas de programación reales:

  • Un modelo de 8B "escribió código completamente incorrecto con confianza"
  • El modelo de 30B "lo hizo perfecto al primer intento"
  • Describieron el rendimiento del modelo de 30B como "básicamente nivel GPT-4o por $0"

Esto sugiere que para ciertas tareas de programación, un modelo de 30B correctamente cuantizado ejecutándose en hardware moderno de CPU puede proporcionar resultados comparables a modelos más grandes basados en la nube, sin la inversión en hardware típicamente asociada con la inferencia local de LLM.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Ver también

Minimax M2.7 y Escalado a más de 100k Instancias de OpenClaw Discutidos en la Sesión del Ecosistema
Noticias

Minimax M2.7 y Escalado a más de 100k Instancias de OpenClaw Discutidos en la Sesión del Ecosistema

Jim y AndyML recibieron al equipo de Minimax para hablar sobre Minimax M2.7 y cómo escalaron su entorno de alojamiento para soportar más de 100,000 instancias de OpenClaw. La sesión atrajo a 100-110 usuarios de Discord y más de 350,000 espectadores en una transmisión simultánea en chino.

OpenClawRadar
El Mínimo de Cinco Asientos de Claude Crea una Brecha de Privacidad para los Profesionales Independientes
Noticias

El Mínimo de Cinco Asientos de Claude Crea una Brecha de Privacidad para los Profesionales Independientes

Las protecciones de privacidad del nivel empresarial de Anthropic requieren un mínimo de cinco asientos, lo que obliga a los profesionales independientes a pagar por asientos vacíos o usar planes de consumo con términos de privacidad inadecuados. Esta brecha contrasta con Google Workspace y los planes empresariales de OpenAI, que ofrecen privacidad de nivel empresarial con precios por asiento individual.

OpenClawRadar
Seis Paralelismos Respaldados por la Investigación entre los Modos de Falla de los LLM y la Cognición del TDAH
Noticias

Seis Paralelismos Respaldados por la Investigación entre los Modos de Falla de los LLM y la Cognición del TDAH

Un desarrollador con TDAH identifica seis paralelismos entre los patrones de fallo de los LLM y la ciencia cognitiva del TDAH, respaldados por investigaciones independientes sobre procesamiento asociativo, confabulación, limitaciones de la memoria de trabajo, completado de patrones, dependencia de la estructura y continuidad del hilo.

OpenClawRadar
sseanliu/VisionClaw trae asistencia de IA en tiempo real a las gafas inteligentes Meta Ray-Ban.
Noticias

sseanliu/VisionClaw trae asistencia de IA en tiempo real a las gafas inteligentes Meta Ray-Ban.

La VisiónClaw de sseanliu ofrece un asistente de IA revolucionario para las gafas inteligentes Meta Ray-Ban, combinando voz, visión y acciones autónomas impulsadas por Gemini Live y OpenClaw.

OpenClawRadar