Benchmarking dos Modelos de IA Mais Recentes: A Ascensão dos Modelos Extremos

O recente benchmarking de 40 novos modelos de IA traz à tona mudanças significativas no cenário de Preço versus Desempenho. Com a atenção focada no Kimi k2.5 e no Claude Opus 4.6, a análise revela uma divisão em dois extremos: 'Modo Deus' e 'Modo Flash', tornando os modelos de faixa intermediária ineficazes.
Detalhes Principais
- Situação do Kimi k2.5: Tentativas de avaliar o Kimi k2.5 foram mal-sucedidas devido a erros persistentes de 'Sem Conteúdo', provavelmente por sobrecarga. No entanto, o Kimi-k2-Thinking teve desempenho adequado para tarefas complexas de raciocínio em ~15 TPS.
- Domínio da Velocidade: Para aplicações sensíveis à latência, o Liquid LFM 2.5 surgiu como o modelo mais rápido, registrando ~359 tokens/seg, seguido pelo Ministral 3B com ~293 tokens/seg.
- Eficiência de Custo: O Ministral 3B se destaca como a solução mais econômica, a US$ 0,10/1 milhão de tokens de entrada. É ~17 vezes mais barato e ~40% mais rápido que o GPT-5.2 Codex, tornando-o uma opção de forte valor contra alternativas mais caras.
A recomendação é evitar modelos de faixa intermediária que custam entre US$ 0,50 e US$ 1,00, pois não oferecem desempenho competitivo. Dependendo de suas necessidades, escolha modelos mais caros como Opus/GPT-5 para inteligência ou opte por velocidade econômica com Liquid/Mistral.
📖 Leia a fonte completa: r/LocalLLaMA
👀 See Also

Hy3 LLM lidera classificações do OpenRouter: modelo mais barato ou algo mais?
Hy3 preview, um LLM open-source da Tencent, disparou para o topo do ranking do OpenRouter por uso de tokens, superando Claude e DeepSeek V4 Flash. Com preço de $0,066/1M tokens de entrada, é o modelo grande mais barato, mas benchmarks mostram qualidade muito abaixo dos líderes.

Claude Opus 4.7: Alterações no Prompt do Sistema: Renomeação da Plataforma, Integração de Ferramentas e Atualizações Comportamentais
A Anthropic atualizou o prompt do sistema Claude Opus da versão 4.6 (5 de fevereiro de 2026) para a 4.7 (16 de abril de 2026), renomeando a 'plataforma de desenvolvedor' para 'Plataforma Claude', adicionando o Claude no Powerpoint à lista de ferramentas, expandindo as instruções de segurança infantil e implementando novas diretrizes comportamentais para uso de ferramentas e concisão nas respostas.

Claude AI creditado nas notas de lançamento da atualização macOS Tahoe 26.5
As notas de lançamento do macOS Tahoe 26.5 da Apple creditam o Claude AI junto com as equipes de engenharia, marcando o primeiro caso conhecido de uma IA sendo formalmente reconhecida no changelog da Apple.

Alibaba proibirá Claude Code no local de trabalho devido a supostos riscos de backdoor
A Alibaba estaria banindo o Claude Code do seu ambiente de trabalho devido a supostos riscos de backdoor, de acordo com uma fonte. A decisão destaca as crescentes preocupações de segurança em torno de agentes de codificação de IA em ambientes corporativos.