Développeur envisage de passer de DeepSeek à Grok pour son agent d'IA financière

Problèmes de performance de l'agent IA financier et changement potentiel
Un développeur a créé une application web d'IA financière en FastAPI/Python qui fonctionne de manière similaire à Perplexity mais pour les actions. L'application exécute un pipeline parallèle avant que le LLM ne traite les requêtes, incluant des cotations boursières en direct de plusieurs API financières, une recherche web en direct d'API de recherche financière et des données de calendrier des résultats. Tout ce contexte structuré est injecté dans l'invite système, le modèle ne gérant que le raisonnement et la mise en forme tandis que les faits proviennent des API, rendant les taux d'hallucination moins pertinents pour ce cas d'utilisation.
Problèmes de performance actuels du modèle
Le développeur utilise actuellement DeepSeek V3.2 Reasoning et signale des problèmes de performance significatifs :
- TTFT (Temps jusqu'au premier jeton) : ~70 secondes
- Vitesse de sortie : ~25 jetons par seconde
- Expérience de streaming décrite comme "terrible"
- Délai de démarrage du streaming fixé à 75 secondes pour éviter les dépassements de délai constants
Exigences de l'application
L'agent IA financier a deux fonctionnalités principales :
- Flux de chat : Analyse financière de style Perplexity avec citations de sources en ligne
- Flux de vérification des transactions : Coach de trading qui produit GO/NO-GO/WAIT avec point d'entrée, stop-loss, objectif et ratio R:R
Les exigences du modèle incluent :
- Performance rapide avec un TTFT faible et un nombre élevé de jetons par seconde pour une UX de streaming
- Coût faible pour un petit projet
- Suffisamment intelligent pour un raisonnement de trading en plusieurs étapes
- Bon suivi des instructions pour des formats de sortie stricts dans les vérifications de transactions
Envisager Grok 4.1 Fast Reasoning
Le développeur envisage de passer à Grok 4.1 Fast Reasoning sur la base de ces comparaisons :
- TTFT : ~15 secondes (contre ~70s pour DeepSeek)
- Vitesse de sortie : ~75 jetons par seconde (contre ~25 t/s pour DeepSeek)
- Score d'intelligence AA : 64 contre 57 pour DeepSeek
- Coût d'entrée : 0,20 $ contre 0,28 $ par million de jetons
Autres modèles envisagés
Le développeur a également examiné Minimax 2.5, Kimi K2.5, les nouveaux modèles Qwen 3.5 et Gemini 3 Flash, mais note que la plupart sont relativement chers et pas meilleurs pour leur cas d'utilisation spécifique.
📖 Read the full source: r/LocalLLaMA
👀 See Also

Siri intégré à Claude Code via un Bot Telegram pour Assistant Personnel IA
Un développeur a créé un assistant IA personnel nommé Snoopy qui connecte Siri à Claude Code via un bot Telegram, permettant des commandes vocales avec une mémoire persistante et des intégrations à Mac, Spotify, WhatsApp, iMessage, Calendrier, navigateur et fichiers.

Du code zéro à 25 millions de parties : le parcours d’un non-ingénieur construisant avec Claude et Cursor
Un développeur sans aucune expérience en programmation a créé trois jeux de navigateur (25 millions de parties jouées au total, 200 000 par jour) en utilisant Claude via Cursor. Deux jeux sont des fichiers HTML uniques de 8 000 lignes. Coût total des outils : environ 2 000 $/mois.

Utiliser des LLM locaux pour le maillage interne sur un site statique
Un développeur a utilisé Gemma3 27B pour créer des liens internes sur 400 pages MDX en générant d'abord une carte de métadonnées, puis en exécutant le modèle par morceaux pour trouver des connexions pertinentes, et en affinant le processus avec un étiquetage automatisé.

Développement de Jeux Steam avec Claude Code : Processus de Revue Technique et Restructuration du Code
Un développeur a utilisé Claude Code pour créer et publier un jeu Steam, détaillant comment il a géré l'intégration du SDK Steamworks, la configuration des dépôts et la localisation pour 7 langues, mais a rencontré des difficultés avec les spécifications d'images et les structures de données en dur.