Reddit-Benutzer meldet 18,8 Tok/s CPU-Inferenz mit Qwen 3 30B Q4 auf Zen 4

Ein Reddit-Nutzer teilte seine Erfahrungen mit dem Testen lokaler LLM-Inferenz auf CPU, anstatt in teure GPU-Hardware zu investieren.
Wichtige Details
Der Nutzer erwog ursprünglich den Kauf von GPU-Hardware für lokale LLM-Inferenz, darunter:
- P40-GPUs
- V100-GPUs (fast eine SXM2-Version gekauft, die nicht in normale Mainboards passt)
- RTX 3090 (aufgrund der KI-Nachfrage für über 800 $)
Nachdem ihm geraten wurde, zunächst CPU-Inferenz zu testen, probierte er aus:
- Modell: Qwen 3 30B Q4
- Hardware: Zen-4-Prozessor mit DDR5-Arbeitsspeicher
- Leistung: 18,8 Token pro Sekunde auf CPU
- Erwartung vs. Realität: Erwartet 3-5 Tok/s, erhielt fast 19 Tok/s
Der Nutzer merkte an, dass „Zen 4 + DDR5 für Inferenz der Wahnsinn ist.“
Praktische Testergebnisse
Der Nutzer führte einen Vergleich mit einer echten Programmieraufgabe durch:
- Ein 8B-Modell „schrieb selbstbewusst völlig falschen Code“
- Das 30B-Modell „hat es auf Anhieb perfekt hinbekommen“
- Er beschrieb die Leistung des 30B-Modells als „im Grunde GPT-4o-Niveau für 0 $“
Dies deutet darauf hin, dass für bestimmte Programmieraufgaben ein richtig quantisiertes 30B-Modell auf moderner CPU-Hardware Ergebnisse liefern kann, die mit größeren cloudbasierten Modellen vergleichbar sind, ohne die typische Hardware-Investition für lokale LLM-Inferenz.
📖 Read the full source: r/LocalLLaMA
👀 Siehe auch

OpenClaw v2026.3.12 Dashboard-Redesign konsolidiert Interface-Elemente
OpenClaw v2026.3.12 bietet ein komplett neu gestaltetes Dashboard, das modulare Ansichten für Chat, Konfiguration, Agenten und Sitzungen sowie Befehls-Palette, mobile Untertabs, Slash-Befehle, Suche, Export und angeheftete Nachrichten in einer einzigen Oberfläche vereint.

Prozessrisiken bei Finanzierungsstrukturen für KI-Rechenzentren
Der Ausbau von KI-Rechenzentren erfordert bis 2030 Investitionen in Höhe von 5,2 Billionen US-Dollar in die Infrastruktur. Unternehmen nutzen komplexe Finanzierungsstrukturen wie Zweckgesellschaften (SPVs) und GPU-besicherte Kreditfazilitäten, die neun Kategorien von Klagerisiken mit sich bringen.

Claude Code v2.1.146: /code-review-Befehl, Paginierungs-Korrektur, Windows-PowerShell-Korrektur
Claude Code v2.1.146 benennt /simplify in /code-review um, mit optionalem Aufwandslevel, behebt MCP-Paginierung und Windows PowerShell-Tool, verbessert die Zuverlässigkeit des Auto-Updaters und die Diff-Rendering-Leistung.

Drei kritische Lücken in OpenClaw für produktive KI-Agenten
Ein Entwickler identifiziert drei fehlende Fähigkeiten in OpenClaw, die verhindern, dass KI-Agenten als echte Mitarbeiter funktionieren: Überprüfbarkeit, granulare Aktionskontrolle und Anweisungsauflösung.