Utilisateur de Reddit rapporte 18,8 tok/s en inférence CPU avec Qwen 3 30B Q4 sur Zen 4

Un utilisateur de Reddit a partagé son expérience de test d'inférence LLM locale sur CPU au lieu d'investir dans du matériel GPU coûteux.
Détails clés
L'utilisateur envisageait d'acheter du matériel GPU pour l'inférence LLM locale, notamment :
- Des GPU P40
- Des GPU V100 (a failli acheter une version SXM2 qui ne se branche pas sur des cartes mères normales)
- Des RTX 3090 (prix à 800 $+ en raison de la demande en IA)
Après avoir été conseillé d'essayer d'abord l'inférence sur CPU, il a testé :
- Modèle : Qwen 3 30B Q4
- Matériel : Processeur Zen 4 avec mémoire DDR5
- Performances : 18,8 tokens par seconde sur CPU
- Attente vs Réalité : Attendu 3-5 tok/s, obtenu près de 19 tok/s
L'utilisateur a noté que "Zen 4 + DDR5 est dingue pour l'inférence".
Résultats pratiques des tests
L'utilisateur a mené une comparaison réelle de tâches de codage :
- Un modèle 8B "a écrit avec confiance un code complètement faux"
- Le modèle 30B "a réussi du premier coup"
- Il a décrit les performances du modèle 30B comme "pratiquement au niveau de GPT-4o pour 0 $"
Cela suggère que pour certaines tâches de codage, un modèle 30B correctement quantifié fonctionnant sur du matériel CPU moderne peut fournir des résultats comparables à ceux de modèles cloud plus grands, sans l'investissement matériel typiquement associé à l'inférence LLM locale.
📖 Read the full source: r/LocalLLaMA
👀 See Also

Anthropic lance Claude Code Channels pour la messagerie depuis Telegram ou Discord
Anthropic a lancé Claude Code Channels, permettant aux développeurs de communiquer avec leurs sessions de codage IA via Telegram ou Discord tout en gardant le code local.

Claude manque de mémoire technique : un incident d'astreinte révèle l'absence de rappel épisodique pour les parcours de débogage
Un développeur a passé 10 heures à déboguer un problème de burst Kafka dans un monorepo de 1500 fichiers, pour se rendre compte qu'il avait résolu exactement le même problème 4 mois plus tôt — révélant que les assistants de codage IA comme Claude manquent de mémoire épisodique pour les parcours de débogage passés.

Systèmes multi-agents : Ingénierie des flux de travail vs Intelligence émergente
Une analyse d'un développeur soutient que les systèmes multi-agents actuels comme LangGraph et les workflows AutoGen fonctionnent davantage comme des microservices avec des enveloppes LLM, fournissant une décomposition des tâches, une parallélisation et une modularité plutôt qu'une véritable intelligence émergente.

Claude Code v2.1.181 : syntaxe /config, événements Apple du bac à sable, correctifs de streaming
Claude Code v2.1.181 ajoute la syntaxe /config clé=valeur pour les réglages en ligne, sandbox.allowAppleEvents sur macOS et CLAUDE_CLIENT_PRESENCE_FILE. Il met également à niveau Bun vers 1.4, corrige la mise en cache des prompts sur les URL d'API personnalisées, les problèmes d'écriture sur les lecteurs réseau et de nombreuses régressions au démarrage.