Développeur envisage de passer de DeepSeek à Grok pour son agent d'IA financière

Problèmes de performance de l'agent IA financier et changement potentiel
Un développeur a créé une application web d'IA financière en FastAPI/Python qui fonctionne de manière similaire à Perplexity mais pour les actions. L'application exécute un pipeline parallèle avant que le LLM ne traite les requêtes, incluant des cotations boursières en direct de plusieurs API financières, une recherche web en direct d'API de recherche financière et des données de calendrier des résultats. Tout ce contexte structuré est injecté dans l'invite système, le modèle ne gérant que le raisonnement et la mise en forme tandis que les faits proviennent des API, rendant les taux d'hallucination moins pertinents pour ce cas d'utilisation.
Problèmes de performance actuels du modèle
Le développeur utilise actuellement DeepSeek V3.2 Reasoning et signale des problèmes de performance significatifs :
- TTFT (Temps jusqu'au premier jeton) : ~70 secondes
- Vitesse de sortie : ~25 jetons par seconde
- Expérience de streaming décrite comme "terrible"
- Délai de démarrage du streaming fixé à 75 secondes pour éviter les dépassements de délai constants
Exigences de l'application
L'agent IA financier a deux fonctionnalités principales :
- Flux de chat : Analyse financière de style Perplexity avec citations de sources en ligne
- Flux de vérification des transactions : Coach de trading qui produit GO/NO-GO/WAIT avec point d'entrée, stop-loss, objectif et ratio R:R
Les exigences du modèle incluent :
- Performance rapide avec un TTFT faible et un nombre élevé de jetons par seconde pour une UX de streaming
- Coût faible pour un petit projet
- Suffisamment intelligent pour un raisonnement de trading en plusieurs étapes
- Bon suivi des instructions pour des formats de sortie stricts dans les vérifications de transactions
Envisager Grok 4.1 Fast Reasoning
Le développeur envisage de passer à Grok 4.1 Fast Reasoning sur la base de ces comparaisons :
- TTFT : ~15 secondes (contre ~70s pour DeepSeek)
- Vitesse de sortie : ~75 jetons par seconde (contre ~25 t/s pour DeepSeek)
- Score d'intelligence AA : 64 contre 57 pour DeepSeek
- Coût d'entrée : 0,20 $ contre 0,28 $ par million de jetons
Autres modèles envisagés
Le développeur a également examiné Minimax 2.5, Kimi K2.5, les nouveaux modèles Qwen 3.5 et Gemini 3 Flash, mais note que la plupart sont relativement chers et pas meilleurs pour leur cas d'utilisation spécifique.
📖 Read the full source: r/LocalLLaMA
👀 See Also

Les non-développeurs créent un éditeur d'actualités IA personnalisé avec Claude
Un utilisateur non technique a créé un système personnalisé de briefing quotidien d'actualités en utilisant Claude AI, commençant par une simple instruction de synthèse et évoluant vers une boîte à outils complète avec filtrage contextuel et vérification des biais.

Leçons pratiques de la construction d’une base de code de 350 000 lignes en solo avec des agents IA
Un développeur partage des perspectives concrètes d'ingénierie issues de la construction d'une base de code de production de 356 000 lignes en 52 jours à l'aide d'agents IA, incluant comment la structure de la base de code affecte la sortie des agents et pourquoi le typage fort est essentiel.

Claude Code Utilisé pour Rétro-ingénier Disney Infinity 1.0, Brisant la Restriction de 13 Ans sur les Personnages
Un développeur a utilisé Claude Code (Opus 4.6 avec raisonnement élevé) pour rétroconcevoir le binaire du jeu Disney Infinity 1.0, identifiant et corrigeant 13 sites d'appel de validation qui empêchaient les personnages de jouer dans n'importe quel set de jeu. La solution a nécessité 17 correctifs binaires et 3 fichiers de données modifiés, résolvant un problème que la communauté de modding n'avait pas pu résoudre pendant plus d'une décennie.

Agent d'IA auto-améliorant plafonné à cause d'une lourdeur procédurale, résolu en réduisant 60% de la configuration.
Un agent IA auto-améliorant d'un développeur a atteint un plateau de performance alors que l'encombrement des processus s'accumulait, le pipeline d'écriture atteignant 10 étapes et la recherche nocturne passant plus de contexte à charger ses instructions qu'à lire des articles. La solution a consisté à réduire d'environ 60 % la configuration racine, à diminuer le pipeline d'écriture de 10 à 5 étapes et à restructurer le cycle de rêve.