Reddit-Benutzer meldet 18,8 Tok/s CPU-Inferenz mit Qwen 3 30B Q4 auf Zen 4

✍️ OpenClawRadar📅 Veröffentlicht: 15. April 2026🔗 Source
Reddit-Benutzer meldet 18,8 Tok/s CPU-Inferenz mit Qwen 3 30B Q4 auf Zen 4
Ad

Ein Reddit-Nutzer teilte seine Erfahrungen mit dem Testen lokaler LLM-Inferenz auf CPU, anstatt in teure GPU-Hardware zu investieren.

Wichtige Details

Der Nutzer erwog ursprünglich den Kauf von GPU-Hardware für lokale LLM-Inferenz, darunter:

  • P40-GPUs
  • V100-GPUs (fast eine SXM2-Version gekauft, die nicht in normale Mainboards passt)
  • RTX 3090 (aufgrund der KI-Nachfrage für über 800 $)

Nachdem ihm geraten wurde, zunächst CPU-Inferenz zu testen, probierte er aus:

  • Modell: Qwen 3 30B Q4
  • Hardware: Zen-4-Prozessor mit DDR5-Arbeitsspeicher
  • Leistung: 18,8 Token pro Sekunde auf CPU
  • Erwartung vs. Realität: Erwartet 3-5 Tok/s, erhielt fast 19 Tok/s

Der Nutzer merkte an, dass „Zen 4 + DDR5 für Inferenz der Wahnsinn ist.“

Ad

Praktische Testergebnisse

Der Nutzer führte einen Vergleich mit einer echten Programmieraufgabe durch:

  • Ein 8B-Modell „schrieb selbstbewusst völlig falschen Code“
  • Das 30B-Modell „hat es auf Anhieb perfekt hinbekommen“
  • Er beschrieb die Leistung des 30B-Modells als „im Grunde GPT-4o-Niveau für 0 $“

Dies deutet darauf hin, dass für bestimmte Programmieraufgaben ein richtig quantisiertes 30B-Modell auf moderner CPU-Hardware Ergebnisse liefern kann, die mit größeren cloudbasierten Modellen vergleichbar sind, ohne die typische Hardware-Investition für lokale LLM-Inferenz.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Siehe auch