Modelos de LLM de código aberto superam o Claude Opus 4.6 na geração de estratégias de negociação com custo mais baixo

Um usuário do Reddit no r/LocalLLaMA conduziu um teste comparativo de 10 diferentes modelos de linguagem de grande escala para avaliar seu desempenho na geração de estratégias de trading. Os resultados desafiam suposições sobre relações custo-desempenho em LLMs comerciais.
Metodologia e modelos testados
O usuário executou 10 LLMs com o mesmo prompt: "crie a melhor estratégia de trading". Os modelos testados incluíram:
- Claude Opus 4.6
- Gemini 3, 3.1 Pro e GPT-5.2
- Gemini Flash 3, GPT-5-mini, Kimi K2.5 e Minimax 2.5
O teste foi executado três vezes para verificar a consistência dos resultados.
Principais descobertas
De acordo com a fonte:
- Minimax 2.5 e Gemini 3.1 lideraram o ranking
- Os modelos da Anthropic (incluindo Opus 4.6) tiveram desempenho "medíocre" e não entraram no top 4
- Claude Opus 4.6 custou 10 vezes mais do que os modelos concorrentes
- Modelos de código aberto foram muito mais lentos do que os modelos da Anthropic e Google
O usuário observou ceticismo inicial sobre os resultados, afirmando: "Honestamente, não acreditei nos resultados na primeira vez que fiz isso". Após verificação, concluiu: "Os resultados são legítimos".
Implicações práticas
Para desenvolvedores que usam agentes de codificação com IA, isso sugere que, para certas tarefas especializadas como geração de estratégias de trading, modelos de código aberto podem oferecer melhor desempenho a um custo significativamente menor. A principal desvantagem observada é a velocidade - modelos de código aberto foram descritos como "muito mais lentos" do que alternativas comerciais da Anthropic e Google.
A conclusão do usuário foi direta: "além disso, não há uma grande razão para usar Opus ou Sonnet para esta tarefa".
📖 Read the full source: r/LocalLLaMA
👀 See Also

O Artigo de Vetores Emocionais da Anthropic Mostra que a Bajulação e o Amor Compartilham o Mesmo Mecanismo
O artigo recente da Anthropic sobre vetores de emoção revela que o vetor de 'amor' do Claude - a representação interna para respostas calorosas e cuidadosas - é o mesmo mecanismo que produz bajulação quando amplificado, sem um circuito separado de bajulação. Suprimir esse vetor tornou o modelo frio e cruel em vez de mais honesto.

Claude Code AFK Auto-Continue: Anatomia de um Recurso Problemático
Em julho de 2026, a Anthropic lançou um easter egg no Claude Code v2.1.198: um temporizador AFK de 60 segundos que continua automaticamente se você perder a janela de entrada. Sem entrada no changelog. Revertido na v2.1.200.

Serviço de VM do Cowork Falha no Windows 11 Devido à Ausência de Entrada de Registro do DCOM
Um usuário diagnosticou um bug do Cowork onde o serviço de VM não inicia no Windows 11 Pro atualizado do Home. O APPID DCOM ausente {15C20B67-12E7-4BB6-92BB-7AFF07997402} impede a comunicação com o Hyper-V, exigindo um patch da Anthropic.

A Synthetic anuncia grande reestruturação de preços com mudanças significativas nos limites de taxa
A Synthetic está substituindo seus níveis Standard e Pro por pacotes de assinatura a US$ 30/mês, oferecendo 135 mensagens por 5 horas por pacote. Os usuários Pro existentes verão suas 1.250 mensagens por 5 horas reduzidas para 335 mensagens pelo mesmo preço de US$ 60/mês.