Profil de Coût des LLM : Un outil open source qui suit les dépenses d'API pour justifier les modèles locaux.

LLM Cost Profiler est un outil Python open source qui suit chaque appel API que votre code effectue vers OpenAI et Anthropic, montrant précisément ce que vous dépensez, où et pourquoi. L'outil révèle quelles tâches sont surévaluées par rapport à leur complexité, fournissant des données concrètes pour justifier l'inférence locale.
Fonctionnalités et découvertes clés
L'outil stocke tout en local dans SQLite et est sous licence MIT. Selon la source, il a identifié plusieurs exemples spécifiques de gaspillage d'appels API :
- Un classificateur utilisant GPT-4o qui produit l'une de 5 étiquettes — une tâche que n'importe quel modèle local 7B décent gère facilement. Coût : ~89 $/semaine en appels API.
- Des milliers d'appels en double vers le même prompt — aucune mise en cache. L'inférence locale avec mise en cache rendrait cela pratiquement gratuit.
- Un outil de synthèse où 34 % des appels étaient des tentatives répétées dues à des erreurs de format. Un modèle local bien réglé avec une génération contrainte élimine toute cette catégorie de gaspillage.
L'auteur note que cet outil donne aux équipes des arguments concrets pour investir dans une infrastructure d'inférence locale : "Voici le montant exact en dollars que nous économiserions en déplaçant la tâche X vers un modèle local."
L'outil est disponible sur GitHub à https://github.com/BuildWithAbid/llm-cost-profiler. L'auteur prévoit d'ajouter le suivi des coûts d'inférence des modèles locaux également (coût basé sur le temps de calcul) et a demandé à la communauté si cela serait utile.
Ce type d'outil de profilage des coûts est particulièrement pertinent pour les développeurs utilisant des agents de codage IA, car il fournit des informations basées sur les données pour identifier où les dépenses API pourraient être inefficaces par rapport aux alternatives locales.
📖 Read the full source: r/LocalLLaMA
👀 See Also

Complexité Temporelle MCP : L'Outil d'Analyse Statique Transmet la Complexité en Notation Grand O aux Agents d'IA de Codage
Time Complexity MCP est un serveur MCP open source qui effectue une analyse statique de code pour détecter la complexité Big-O, transmettant directement les résultats à des agents d'IA de codage comme Claude Code ou Copilot sans consommation de tokens. Il prend en charge JavaScript, TypeScript, Python, Java, Kotlin et Dart.

L'extension Event Horizon pour VS Code ajoute le verrouillage de fichiers et la coordination des plans pour plusieurs agents IA.
Event Horizon, une extension VS Code initialement créée pour visualiser Claude Code, inclut désormais des fonctionnalités de verrouillage de fichiers et de coordination de plans pour empêcher plusieurs agents IA d'écraser mutuellement leur travail sur la même base de code. L'outil prend en charge Claude Code, OpenCode et Copilot avec une configuration en un clic.

Cognithor v0.40.0 ajoute une identité persistante aux agents IA avec des contraintes éthiques.
Cognithor v0.40.0 introduit le Protocole d'Esprit Immortel, offrant aux agents d'IA locaux une identité persistante entre les sessions avec 7 ancres éthiques intégrées et des cycles de rêve pour la consolidation de la mémoire. La mise à jour ajoute 9 488 lignes de code et fonctionne à 100 % localement.

Ultime MCP Unreal Engine : Claude Code peut désormais construire et vérifier des niveaux Unreal Engine avec 132 outils
Un serveur MCP open-source expose 132 outils dans 26 domaines, permettant à Claude de générer des acteurs, définir des valeurs UPROPERTY, prendre des captures d'écran, naviguer dans les caméras et s'auto-corriger après les mutations.