Développeur envisage de passer de DeepSeek à Grok pour son agent d'IA financière

✍️ OpenClawRadar📅 Publié: March 19, 2026🔗 Source
Développeur envisage de passer de DeepSeek à Grok pour son agent d'IA financière
Ad

Problèmes de performance de l'agent IA financier et changement potentiel

Un développeur a créé une application web d'IA financière en FastAPI/Python qui fonctionne de manière similaire à Perplexity mais pour les actions. L'application exécute un pipeline parallèle avant que le LLM ne traite les requêtes, incluant des cotations boursières en direct de plusieurs API financières, une recherche web en direct d'API de recherche financière et des données de calendrier des résultats. Tout ce contexte structuré est injecté dans l'invite système, le modèle ne gérant que le raisonnement et la mise en forme tandis que les faits proviennent des API, rendant les taux d'hallucination moins pertinents pour ce cas d'utilisation.

Problèmes de performance actuels du modèle

Le développeur utilise actuellement DeepSeek V3.2 Reasoning et signale des problèmes de performance significatifs :

  • TTFT (Temps jusqu'au premier jeton) : ~70 secondes
  • Vitesse de sortie : ~25 jetons par seconde
  • Expérience de streaming décrite comme "terrible"
  • Délai de démarrage du streaming fixé à 75 secondes pour éviter les dépassements de délai constants
Ad

Exigences de l'application

L'agent IA financier a deux fonctionnalités principales :

  • Flux de chat : Analyse financière de style Perplexity avec citations de sources en ligne
  • Flux de vérification des transactions : Coach de trading qui produit GO/NO-GO/WAIT avec point d'entrée, stop-loss, objectif et ratio R:R

Les exigences du modèle incluent :

  • Performance rapide avec un TTFT faible et un nombre élevé de jetons par seconde pour une UX de streaming
  • Coût faible pour un petit projet
  • Suffisamment intelligent pour un raisonnement de trading en plusieurs étapes
  • Bon suivi des instructions pour des formats de sortie stricts dans les vérifications de transactions

Envisager Grok 4.1 Fast Reasoning

Le développeur envisage de passer à Grok 4.1 Fast Reasoning sur la base de ces comparaisons :

  • TTFT : ~15 secondes (contre ~70s pour DeepSeek)
  • Vitesse de sortie : ~75 jetons par seconde (contre ~25 t/s pour DeepSeek)
  • Score d'intelligence AA : 64 contre 57 pour DeepSeek
  • Coût d'entrée : 0,20 $ contre 0,28 $ par million de jetons

Autres modèles envisagés

Le développeur a également examiné Minimax 2.5, Kimi K2.5, les nouveaux modèles Qwen 3.5 et Gemini 3 Flash, mais note que la plupart sont relativement chers et pas meilleurs pour leur cas d'utilisation spécifique.

📖 Read the full source: r/LocalLLaMA

Ad

👀 See Also

Les non-développeurs créent un éditeur d'actualités IA personnalisé avec Claude
Use Cases

Les non-développeurs créent un éditeur d'actualités IA personnalisé avec Claude

Un utilisateur non technique a créé un système personnalisé de briefing quotidien d'actualités en utilisant Claude AI, commençant par une simple instruction de synthèse et évoluant vers une boîte à outils complète avec filtrage contextuel et vérification des biais.

OpenClawRadar
Leçons pratiques de la construction d’une base de code de 350 000 lignes en solo avec des agents IA
Use Cases

Leçons pratiques de la construction d’une base de code de 350 000 lignes en solo avec des agents IA

Un développeur partage des perspectives concrètes d'ingénierie issues de la construction d'une base de code de production de 356 000 lignes en 52 jours à l'aide d'agents IA, incluant comment la structure de la base de code affecte la sortie des agents et pourquoi le typage fort est essentiel.

OpenClawRadar
Claude Code Utilisé pour Rétro-ingénier Disney Infinity 1.0, Brisant la Restriction de 13 Ans sur les Personnages
Use Cases

Claude Code Utilisé pour Rétro-ingénier Disney Infinity 1.0, Brisant la Restriction de 13 Ans sur les Personnages

Un développeur a utilisé Claude Code (Opus 4.6 avec raisonnement élevé) pour rétroconcevoir le binaire du jeu Disney Infinity 1.0, identifiant et corrigeant 13 sites d'appel de validation qui empêchaient les personnages de jouer dans n'importe quel set de jeu. La solution a nécessité 17 correctifs binaires et 3 fichiers de données modifiés, résolvant un problème que la communauté de modding n'avait pas pu résoudre pendant plus d'une décennie.

OpenClawRadar
Agent d'IA auto-améliorant plafonné à cause d'une lourdeur procédurale, résolu en réduisant 60% de la configuration.
Use Cases

Agent d'IA auto-améliorant plafonné à cause d'une lourdeur procédurale, résolu en réduisant 60% de la configuration.

Un agent IA auto-améliorant d'un développeur a atteint un plateau de performance alors que l'encombrement des processus s'accumulait, le pipeline d'écriture atteignant 10 étapes et la recherche nocturne passant plus de contexte à charger ses instructions qu'à lire des articles. La solution a consisté à réduire d'environ 60 % la configuration racine, à diminuer le pipeline d'écriture de 10 à 5 étapes et à restructurer le cycle de rêve.

OpenClawRadar