Comparação de Desempenho de 88 Modelos GGUF Pequenos em um Mac Mini M4 de 16GB

Foi desenvolvido um pipeline automatizado para baixar, avaliar, fazer upload e excluir modelos GGUF em lotes em um Mac Mini M4 com 16GB de memória unificada. O pipeline testou 88 modelos para encontrar LLMs locais adequados para esta configuração de hardware.
Principais Descobertas
- 9 dos 88 modelos são inutilizáveis em 16GB de RAM - Qualquer modelo onde os pesos mais o cache KV excedam aproximadamente 14GB causa thrashing de memória, resultando em TTFT > 10 segundos ou < 0,1 tokens/segundo. Isso inclui todos os modelos densos 27B+.
- Apenas 4 modelos estão na fronteira de Pareto de throughput vs qualidade - Todos são da arquitetura LFM2-8B-A1B (MoE da LiquidAI com 1B parâmetros ativos). O design MoE significa que apenas cerca de 1B parâmetros estão ativos por token, alcançando 12-20 tokens/segundo, enquanto modelos densos 8B atingem no máximo 5-7 tokens/segundo.
- A escalabilidade de contexto de 1k para 4k é plana - A maioria dos modelos mostra degradação zero de throughput, com algumas variantes LFM2 realmente acelerando em contexto de 4k.
- A escalabilidade de concorrência é ruim (0,57x na concorrência 2 vs ideal 2,0x) - O Mac Mini é limitado pela largura de banda da memória, portanto, recomenda-se executar uma solicitação por vez.
Modelos da Fronteira de Pareto
Estes quatro modelos superam todos os outros em velocidade e qualidade:
- LFM2-8B-A1B-Q5_K_M (unsloth): 14,24 TPS média, pontuação de qualidade 44,6
- LFM2-8B-A1B-Q8_0 (unsloth): 12,37 TPS média, pontuação de qualidade 46,2
- LFM2-8B-A1B-UD-Q8_K_XL (unsloth): 12,18 TPS média, pontuação de qualidade 47,9
- LFM2-8B-A1B-Q8_0 (LiquidAI): 12,18 TPS média, pontuação de qualidade 51,2
A avaliação de qualidade usou subconjuntos compactos (20 questões GSM8K + 60 questões MMLU) - útil direcionalmente para classificação, mas não números absolutos de nível de publicação.
Recomendações
Para melhor qualidade: LFM2-8B-A1B-Q8_0. Para velocidade: Q5_K_M. Para equilíbrio: UD-Q6_K_XL.
Detalhes Técnicos
- Hardware: Mac Mini M4, 16GB de memória unificada, macOS 15.x
- Software: llama-server (llama.cpp)
- Metodologia: Os números de throughput são p50 em múltiplas solicitações
- Dados: Todos os dados são reproduzíveis a partir de artefatos no repositório
O pipeline completo é automatizado e de código aberto. Dados CSV com todos os 88 modelos e scripts de benchmark estão disponíveis no repositório.
📖 Leia a fonte completa: r/LocalLLaMA
👀 See Also

Rascunho do Encontro Qwen: Harness de Chamada de Funções 2 Aumenta Conformidade CoT de 9,91% para 100% por meio de Esquemas Estruturados
Uma continuação do post anterior sobre o harness de function-calling estende o padrão para domínios sem um compilador (memorandos de investimento, pareceres jurídicos, prontuários clínicos). O schema exige campos obrigatórios — a submissão é rejeitada se incompleta. Qwen3.6-27b atinge 100% de conformidade CoT nesses schemas.

Benchmark de Criatividade Humana: Separando Convergência de Divergência na Avaliação Criativa de IA
Contra Labs apresenta o Human Creativity Benchmark (HCB), uma estrutura que distingue critérios objetivamente verificáveis (ex.: aderência ao prompt) do gosto subjetivo (ex.: apelo visual) na avaliação de IA generativa para trabalho criativo. O benchmark revela que nenhum modelo atual é confiavelmente correto e orientável, abordando o colapso de modo e a necessidade de saída diferenciada.

A ferramenta de correção de memória do OpenClaw resolve a degradação de desempenho.
Um novo comando de barra chamado /claw_memory_fix ajuda a limpar arquivos de memória do OpenClaw quando o agente esquece credenciais ou permissões. A ferramenta implementa técnicas da Alibaba, engenharia do GitHub, MemGPT e pesquisas de janeiro de 2026 sobre gerenciamento de memória.

Configurações Ephemeral OpenClaw com isolamento de rede e desmontagem automática
Uma configuração que inicializa o OpenClaw dentro de uma VM efêmera com uma lista de permissões de saída de rede, injeta chaves de API em armazenamento baseado em RAM e inclui uma autodestruição de 2 horas. Todas as chamadas de LLM são registradas no SQLite para reprodução.