Utilisateur de Reddit rapporte 18,8 tok/s en inférence CPU avec Qwen 3 30B Q4 sur Zen 4

Un utilisateur de Reddit a partagé son expérience de test d'inférence LLM locale sur CPU au lieu d'investir dans du matériel GPU coûteux.
Détails clés
L'utilisateur envisageait d'acheter du matériel GPU pour l'inférence LLM locale, notamment :
- Des GPU P40
- Des GPU V100 (a failli acheter une version SXM2 qui ne se branche pas sur des cartes mères normales)
- Des RTX 3090 (prix à 800 $+ en raison de la demande en IA)
Après avoir été conseillé d'essayer d'abord l'inférence sur CPU, il a testé :
- Modèle : Qwen 3 30B Q4
- Matériel : Processeur Zen 4 avec mémoire DDR5
- Performances : 18,8 tokens par seconde sur CPU
- Attente vs Réalité : Attendu 3-5 tok/s, obtenu près de 19 tok/s
L'utilisateur a noté que "Zen 4 + DDR5 est dingue pour l'inférence".
Résultats pratiques des tests
L'utilisateur a mené une comparaison réelle de tâches de codage :
- Un modèle 8B "a écrit avec confiance un code complètement faux"
- Le modèle 30B "a réussi du premier coup"
- Il a décrit les performances du modèle 30B comme "pratiquement au niveau de GPT-4o pour 0 $"
Cela suggère que pour certaines tâches de codage, un modèle 30B correctement quantifié fonctionnant sur du matériel CPU moderne peut fournir des résultats comparables à ceux de modèles cloud plus grands, sans l'investissement matériel typiquement associé à l'inférence LLM locale.
📖 Read the full source: r/LocalLLaMA
👀 See Also
Claude Code v2.1.273 ajoute des en-têtes d’indication de passerelle, des alertes de reconnexion MCP et la duplication de session de contrôle à distance
Claude Code v2.1.273 ajoute des en-têtes de requête LLM gateway optionnels, une notification de déconnexion MCP abandonnée et le fork des sessions Remote Control. Il corrige aussi le déclenchement de l'auto-compact à environ la moitié de la fenêtre de contexte réelle.

Traduction en français : Modifications de l'Invite Système de Claude Opus 4.7 : Renommage de la Plateforme, Intégration d'Outils et Mises à Jour Comportementales
Anthropic a mis à jour l'invite système de Claude Opus de la version 4.6 (5 février 2026) à la 4.7 (16 avril 2026), renommant la 'plateforme développeur' en 'Claude Platform', ajoutant Claude dans Powerpoint à la liste des outils, élargissant les instructions de sécurité des enfants et mettant en œuvre de nouvelles directives comportementales pour l'utilisation des outils et la concision des réponses.

Développeur plaide coupable dans une escroquerie de 8 millions de dollars via un système de streaming musical utilisant l'IA
Michael Smith, 54 ans, a admis avoir utilisé des milliers de comptes automatisés et des chansons générées par IA pour détourner 8 millions de dollars de redevances de plateformes de streaming, notamment Spotify, Apple Music et YouTube Music, entre 2017 et 2024.

Databricks réduit les coûts de codage IA de 70 % : flexibilité des modèles, open source et frontière de l’efficacité
Databricks a réduit de 70 % ses dépenses en codage IA en adoptant rapidement des modèles open source efficaces, en créant des benchmarks internes et en imposant une flexibilité des modèles. Leviers clés : déploiement de GLM et abandon d'Opus 5.0 en raison de régressions de coûts.