Création d'un serveur LLM local à 6 400 $ : Répartition du coût total de possession par rapport aux coûts d'API

Un développeur sur r/LocalLLaMA a publié une analyse de coût approfondie de son serveur LLM local à 6 406,45 $, incluant la dépréciation et l'électricité, comparé aux tarifs API. Le serveur utilise quatre GPU AMD MI100 32 Go d'occasion avec llama.cpp exécutant Qwen3.6 27B, traitant 20,4 millions de tokens d'entrée et 1,32 million de tokens de sortie par jour.
Spécifications matérielles
- 4x MI100 32 Go (occasion) : 4 234,82 $
- Carte mère ASRock EPYCD8-2T : 721,61 $
- Alimentation 1600 W 80+ Platinum : 497,95 $
- 8x8 Go DDR4 ECC RDIMM (occasion) : 348,79 $
- CPU EPYC 7K62 48 cœurs (occasion) : 254,28 $
- Ventilateur CPU, boîtier, soufflantes, câbles : ~349 $
- Total : 6 406,45 $
Performances et comparaison des coûts
À 0,29 $/M d'entrée et 3,2 $/M de sortie sur OpenRouter pour Qwen3.6 27B, le coût quotidien équivalent API est de 10,14 $, soit 3 701,10 $/an. Le serveur local produit les mêmes tokens pour un coût électrique quotidien de 2,11 $ (630 W à 0,14 $/kWh), soit 770,15 $/an.
Comptabilisation de la dépréciation
L'auteur utilise un modèle de dépréciation réaliste : accessoires 100 % de perte, pièces neuves 50 % de perte, pièces d'occasion 10 % de perte. Cela donne un coût de dépréciation matérielle unique de 1 442,57 $, qui reste à peu près le même que l'on vende après 1 jour ou 5 ans.
Après un an, le coût local total = 770 $ (électricité) + 1 443 $ (dépréciation) = 2 213 $, contre 3 701 $ pour l'API — une économie de 1 488 $.
Comparaison des forfaits de codage
Pour contexte, le meilleur forfait de codage de Z.AI (144 $/mois) fournit environ 4,5 M d'entrée/200 k sortie tokens/jour de GLM 4.7, ce qui, normalisé à la même capacité que le serveur local, coûterait 652,80 $/mois ou 7 833,60 $/an — plus du double du tarif OpenRouter pour le même modèle.
L'auteur note que les forfaits de codage ne sont pas toujours avantageux et conseille de vérifier ce que vous payez réellement en tokens.
📖 Lire la source complète : r/LocalLLaMA
👀 See Also

Claude Code a construit Treelo : un outil gratuit de transcription vidéo
Un monteur vidéo a utilisé Claude Code pour créer Treelo, un outil gratuit qui transcrit les fichiers vidéo/audio, supprime les mots de remplissage, permet le placement d'effets sonores à des horodatages précis et exporte des fichiers SRT pour Premiere ou ASS pour DaVinci Resolve.

Mentor de Carrière Multi-Agents Construit avec Ollama et MCP pour l'IA Locale
Un développeur a construit un système d'IA à 5 agents qui analyse les CV et génère des rapports d'intelligence de carrière en utilisant Ollama avec llama3 localement. Le système enchaîne les sorties des agents de sorte que chacun s'appuie sur le contexte précédent, avec MCP gérant l'intégration des outils.

Gestion des Tâches Multiples d'Agents IA avec des Tableaux Kanban
Un développeur partage son expérience de l'exécution de plusieurs agents d'IA Claude dans des onglets de terminal et identifie trois défis clés de flux de travail : manque de visibilité sur la progression, perte de contexte lors du passage d'une tâche à l'autre, et interruptions dues aux limites de taux. Sa solution consiste à traiter les tâches d'IA comme des éléments de travail sur un tableau Kanban.

SkillOpt : Optimisation des fichiers de compétences Markdown en tant que paramètres entraînables pour les agents IA
SkillOpt formalise le processus ad hoc d'édition de fichiers markdown de compétences pour les agents de codage IA, en utilisant des modèles de pointe pour proposer des modifications limitées validées par des ensembles de validation. Les meilleures compétences convergent avec 1 à 4 modifications acceptées parmi de nombreuses propositions, et se transfèrent entre modèles comme Codex vers Claude Code.