Benchmarking dos Modelos de IA Mais Recentes: A Ascensão dos Modelos Extremos

O recente benchmarking de 40 novos modelos de IA traz à tona mudanças significativas no cenário de Preço versus Desempenho. Com a atenção focada no Kimi k2.5 e no Claude Opus 4.6, a análise revela uma divisão em dois extremos: 'Modo Deus' e 'Modo Flash', tornando os modelos de faixa intermediária ineficazes.
Detalhes Principais
- Situação do Kimi k2.5: Tentativas de avaliar o Kimi k2.5 foram mal-sucedidas devido a erros persistentes de 'Sem Conteúdo', provavelmente por sobrecarga. No entanto, o Kimi-k2-Thinking teve desempenho adequado para tarefas complexas de raciocínio em ~15 TPS.
- Domínio da Velocidade: Para aplicações sensíveis à latência, o Liquid LFM 2.5 surgiu como o modelo mais rápido, registrando ~359 tokens/seg, seguido pelo Ministral 3B com ~293 tokens/seg.
- Eficiência de Custo: O Ministral 3B se destaca como a solução mais econômica, a US$ 0,10/1 milhão de tokens de entrada. É ~17 vezes mais barato e ~40% mais rápido que o GPT-5.2 Codex, tornando-o uma opção de forte valor contra alternativas mais caras.
A recomendação é evitar modelos de faixa intermediária que custam entre US$ 0,50 e US$ 1,00, pois não oferecem desempenho competitivo. Dependendo de suas necessidades, escolha modelos mais caros como Opus/GPT-5 para inteligência ou opte por velocidade econômica com Liquid/Mistral.
📖 Leia a fonte completa: r/LocalLLaMA
👀 See Also

Allbirds muda de calçados para infraestrutura de IA, ações disparam 580%
A marca de calçados Allbirds anunciou um acordo de US$ 50 milhões para se tornar uma empresa de infraestrutura de computação de IA chamada NewBird AI, fazendo suas ações subirem 580%. A empresa planeja comprar GPUs e oferecer chips gráficos sob demanda e serviços em nuvem para IA.
Claude Code v2.1.273 adiciona cabeçalhos de dica de gateway, alertas de reconexão MCP e bifurcação de sessão de controle remoto
O Claude Code v2.1.273 adiciona cabeçalhos de requisição opcionais para gateways de LLM, uma notificação de desconexão e desistência do MCP, e bifurcação para sessões do Controle Remoto. Também corrige o auto-compact disparando com cerca da metade da janela de contexto real.

Atualização do OpenClaw 3.31 redefine permissões e configurações do agente
A atualização 3.31 do OpenClaw desativou automaticamente todas as ferramentas de agentes, permissões de acesso ao computador e subagentes, exigindo reativação manual nas Configurações. A atualização também alterou o funcionamento das solicitações de permissão, não solicitando mais aprovação durante o uso.

Vazamento do código-fonte do Claude revela sistema de memória autoDream e padrões multiagente
A Anthropic acidentalmente enviou o código-fonte TypeScript do Claude Code nos mapas de origem do npm, revelando a consolidação de memória autoDream, a arquitetura modular de prompts do sistema e os padrões de coordenador multiagente.