O benchmark mostra que o modelo menor de 4B supera LLMs maiores em aplicações de chat telefone-casa.

Resultados do benchmark de chat telefone-para-casa
Um benchmark recente avaliou 8 LLMs locais para aplicações de chat telefone-para-casa onde a inferência é executada em um computador doméstico. O teste envolveu 640 avaliações (8 modelos × 8 conjuntos de dados × 10 amostras) em hardware Mac mini M4 Pro 24Gb.
Fórmula de aptidão e ponderação
A fórmula de aptidão composta ponderou três fatores: 50% experiência do usuário no chat, 30% velocidade e 20% qualidade de texto curto. Essa ponderação prioriza a experiência do usuário para aplicações móveis onde a latência é mais importante.
Principais descobertas
- Gemma3:4B venceu com uma pontuação de aptidão composta de 88,7, apesar de ser o menor modelo testado
- Alcançou o menor TTFT (11,2s), maior throughput (89,3 tok/s) e temperaturas mais baixas (45°C)
- Modelos maiores como GPT-OSS:20B passaram em 70% das tarefas, mas ficaram em 6º lugar devido ao TTFT médio de 25,4s
- O desempenho térmico variou significativamente: Qwen3:14B atingiu pico de 83°C, DeepSeek-R1:14B a 81°C
- Magistral:24B foi excluído da classificação final após acionar loops de timeout e atingir 97°C de temperatura da GPU
Por que modelos menores tiveram melhor desempenho
O benchmark revelou que para aplicações de chat por telefone, tempos de resposta do primeiro token (TTFT) mais rápidos e menor carga térmica importam mais do que precisão bruta. Um modelo com 77,5% de precisão, mas que requer 25s de espera pelo primeiro token, perde para um que responde com 72,5% de precisão, mas responde em 11s. A diferença térmica é significativa para confiabilidade e longevidade do hardware pessoal.
Análise independente
Uma análise independente usando Claude no mesmo conjunto de dados de 640 avaliações ponderou confiabilidade e TTFT de forma mais agressiva e chegou a uma ordem ligeiramente diferente no top-4, confirmando que a ponderação de KPIs é uma escolha, não uma verdade absoluta.
Considerações de caso de uso
O autor observa que para diferentes casos de uso, como programação ou redação de textos longos, a fórmula de ponderação seria completamente invertida, priorizando qualidade em vez de velocidade e experiência do usuário no chat.
📖 Leia a fonte completa: r/LocalLLaMA
👀 See Also

Ubuntu Linux integrará recursos de IA no próximo ano, começando com inferência local
A Canonical anuncia uma iniciativa de IA plurianual para o Ubuntu, com foco em inferência local, fluxos de trabalho agênticos e recursos de SO sensíveis ao contexto, com recursos sendo lançados ao longo de 2026.

Xiaomi MiMo-V2-Pro Modelo de IA Disponível Gratuitamente no OpenRouter por 7 Dias
O modelo de IA MiMo-V2-Pro da Xiaomi está disponível com acesso gratuito à API no OpenRouter por 7 dias. O modelo possui uma janela de contexto de 1 milhão de tokens e benchmarks mostram que ele compete com o Claude Opus 4.6 e se aproxima do desempenho do GPT-5.2.

Pesquisa sobre a Consistência de Agentes de IA: Principais Descobertas e Aplicações Práticas
Um estudo de 3.000 experimentos com Claude, GPT-4o e Llama revela que agentes consistentes alcançam 80–92% de precisão, enquanto os inconsistentes caem para 25–60%, com 69% da divergência ocorrendo na primeira chamada de ferramenta.

A Bolha de IA Não É Como a Bolha da Internet — Trabalhadores Não Vão Contrabandear IA Como Contrabandearam Planilhas
Cory Doctorow argumenta que a bolha de IA difere fundamentalmente da era pontocom: trabalhadores contrabandeavam ferramentas da internet para as redes corporativas porque elas ajudavam a fazer seus trabalhos. Ninguém está contrabandeando agentes de IA — eles estão sendo empurrados pela gerência.