Resultados de Benchmark: 15 LLMs Testados em 38 Tarefas de Fluxo de Trabalho Real

Um desenvolvedor criou um sistema de avaliação para determinar para quais LLMs direcionar o trabalho, testando 15 modelos em 38 tarefas de seu fluxo de trabalho real. As tarefas incluíram transformações de CSV, contagem de letras, aritmética modular, conformidade de formato e instruções de múltiplas etapas. Todas as tarefas foram pontuadas programaticamente usando regex e correspondência exata—nenhum juiz LLM foi envolvido.
Resultados da Avaliação
A avaliação envolveu 570 chamadas de API custando $2,29 no total. Principais descobertas:
- Claude 3.5 Opus: 100% de pontuação, $0,69 por execução, 14,2 segundos
- Claude 3.5 Sonnet: 100% de pontuação, $0,20 por execução, 5,1 segundos
- MiniMax M2.5: 98,60% de pontuação, $0,02 por execução, 2,3 segundos
- Kimi K2.5: 98,60% de pontuação, $0,05 por execução, 3,8 segundos
- GPT-oss-20b (local): 98,30% de pontuação, $0 por execução, 4,1 segundos
- Gemini 2.5 Flash: 97,10% de pontuação, $0,00 por execução, 1,1 segundos
- Claude 3.5 Haiku: 96,90% de pontuação, $0,02 por execução, 1,8 segundos
Análise de Custo-Desempenho
Sonnet e Opus obtiveram 100%, mas o Opus custa 3,5 vezes mais por chamada. Para as tarefas diárias do desenvolvedor, o Sonnet lida com tudo que o Opus faz. O Gemini Flash a $0,003 por execução versus o Opus a $0,69 por execução representa uma diferença de custo de 265 vezes para uma diferença de desempenho de 2,9 pontos.
Descobertas Surpreendentes
MiniMax M2.5 e Kimi K2.5 alcançaram 98,6% com 100% de conformidade de formato—o desenvolvedor não havia usado nenhum dos modelos antes de executar a avaliação. O GPT-oss-20b rodando localmente obteve 98,3% por $0, superando o Haiku e o DeepSeek R1.
Processo de QA
O processo de garantia de qualidade revelou bugs de pontuação. Os resultados iniciais mostraram o Haiku superando o Sonnet, o que acabou sendo um bug no sistema de pontuação que produzia notas acima de 100%. Cinco verificações de QA foram realizadas, cada uma com um modelo diferente, e cada uma encontrou bugs que as anteriores haviam perdido.
O desenvolvedor está mudando seu uso diário para o Sonnet com base nesses resultados, mas planeja alternar entre modelos com mais frequência dadas as variações de desempenho.
📖 Read the full source: r/ClaudeAI
👀 See Also

PeaDB: Banco de Dados Compatível com Redis Codificado com Assistência de IA em C++20
Um desenvolvedor criou o PeaDB, uma substituição direta do Redis 7.2.5 escrita em C++20 usando Codex, Copilot e Claude, implementando cerca de 147 comandos com persistência, replicação e suporte a cluster. Os benchmarks mostram desempenho próximo ao do Redis.

TEMM1E v3.0.0 Introduz Inteligência de Enxame para Coordenação de Agentes de IA
TEMM1E v3.0.0 adiciona 'Many Tems', uma inteligência de enxame que coordena trabalhadores de agentes de IA através de sinais de estigmergia em vez de chamadas de LLM, alcançando desempenho 5,86x mais rápido e custo 3,4x menor em tarefas complexas com zero tokens de coordenação.

Comparando Sistemas de IA Multiagente: Harness da Anthropic vs Modelo de Engenharia Organizacional da Agyn
A Anthropic publicou um design de estrutura para desenvolvimento de aplicações de longa duração, enquanto o sistema multiagente Agyn para engenharia de software autônoma baseada em equipe foi disponibilizado em código aberto no mês passado. Ambos os sistemas rejeitam agentes monolíticos em favor de separação de papéis, transferências estruturadas e ciclos de revisão.

Comparando Agentes de IA Locais vs. na Nuvem: OpenClaw e Twin.so
OpenClaw é um agente de IA local de código aberto que roda na sua máquina com controle total dos dados, enquanto Twin.so é uma plataforma baseada em nuvem com mais de 200.000 agentes construídos pela comunidade para automação 24/7.