Desenvolvedor Considera Mudar do DeepSeek para o Grok para Agente de IA Financeira

Problemas de Desempenho do Agente de IA Financeira e Possível Mudança
Um desenvolvedor construiu um aplicativo web de IA financeira em FastAPI/Python que funciona de forma semelhante ao Perplexity, mas para ações. O aplicativo executa um pipeline paralelo antes que o LLM processe as consultas, incluindo cotações de ações em tempo real de várias APIs financeiras, busca na web em tempo real de APIs de busca financeira e dados do calendário de resultados. Todo esse contexto estruturado é injetado no prompt do sistema, com o modelo lidando apenas com raciocínio e formatação, enquanto os fatos vêm das APIs, tornando as taxas de alucinação menos relevantes para este caso de uso.
Problemas Atuais de Desempenho do Modelo
O desenvolvedor está atualmente usando o DeepSeek V3.2 Reasoning e relata problemas significativos de desempenho:
- TTFT (Tempo para o Primeiro Token): ~70 segundos
- Velocidade de saída: ~25 tokens por segundo
- Experiência de streaming descrita como "terrível"
- Tempo limite de início do streaming definido para 75 segundos para evitar constantes timeouts
Requisitos do Aplicativo
O agente de IA financeira tem duas funcionalidades principais:
- Stream de chat: Análise financeira no estilo Perplexity com citações de fontes inline
- Stream de verificação de trades: Coach de trades que emite GO/NO-GO/WAIT com entrada, stop-loss, alvo e relação R:R
Os requisitos do modelo incluem:
- Desempenho rápido com TTFT baixo e alta taxa de tokens por segundo para UX de streaming
- Custo baixo para um projeto pequeno
- Inteligente o suficiente para raciocínio de trades em múltiplas etapas
- Boa capacidade de seguir instruções para formatos de saída estritos nas verificações de trades
Considerando o Grok 4.1 Fast Reasoning
O desenvolvedor está considerando mudar para o Grok 4.1 Fast Reasoning com base nestas comparações:
- TTFT: ~15 segundos (vs ~70s do DeepSeek)
- Velocidade de saída: ~75 tokens por segundo (vs ~25 t/s do DeepSeek)
- Pontuação de inteligência AA: 64 vs 57 do DeepSeek
- Custo de entrada: US$ 0,20 vs US$ 0,28 por milhão de tokens
Outros Modelos Considerados
O desenvolvedor também analisou o Minimax 2.5, Kimi K2.5, novos modelos Qwen 3.5 e Gemini 3 Flash, mas observa que a maioria é relativamente cara e não melhor para seu caso de uso específico.
📖 Read the full source: r/LocalLLaMA
👀 See Also

Claude Code Agent Teams Constroem Produtos Micro SaaS em 4 Horas Usando Obsidian Vault
Um desenvolvedor criou um sistema completo onde equipes de agentes Claude Code lidam com todo o ciclo de vida de SaaS, desde a descoberta da ideia até a implantação em 4 horas. O sistema usa um cofre Obsidian como memória persistente e equipes de agentes especializadas para pesquisa, validação, desenvolvimento e distribuição.

Compreendendo a Autonomia de Agentes de IA em Aplicações do Mundo Real
A pesquisa recente da Anthropic analisa milhões de interações humano-agente para medir a autonomia de agentes de IA como o Claude Code em diversos domínios.

Desenvolvedor Cria RPG de Navegador em 9 Dias Usando Claude Code e Godot
Um desenvolvedor criou 'Civic Nightmare', um RPG satírico para navegador, em 9 dias usando Godot e Claude Code como parte de um fluxo de trabalho com múltiplas ferramentas de IA. Esta foi a primeira vez que ele usou a engine Godot.

Claude AI Recupera 99,94% dos Dados de um Array BTRFS de 12TB Corrompido
Um desenvolvedor usou a IA Claude para recuperar 99,94% dos dados de um array BTRFS de 12TB corrompido após as ferramentas de recuperação nativas falharem. Claude diagnosticou uma tabela de índice destruída em 80% e reconstruiu manualmente a árvore do sistema de arquivos, perdendo apenas 7MB de arquivos de lixo de 8,4TB de dados.