Comparação de Desempenho de 88 Modelos GGUF Pequenos em um Mac Mini M4 de 16GB

✍️ OpenClawRadar📅 Publicado: March 2, 2026🔗 Source
Comparação de Desempenho de 88 Modelos GGUF Pequenos em um Mac Mini M4 de 16GB
Ad

Foi desenvolvido um pipeline automatizado para baixar, avaliar, fazer upload e excluir modelos GGUF em lotes em um Mac Mini M4 com 16GB de memória unificada. O pipeline testou 88 modelos para encontrar LLMs locais adequados para esta configuração de hardware.

Principais Descobertas

  • 9 dos 88 modelos são inutilizáveis em 16GB de RAM - Qualquer modelo onde os pesos mais o cache KV excedam aproximadamente 14GB causa thrashing de memória, resultando em TTFT > 10 segundos ou < 0,1 tokens/segundo. Isso inclui todos os modelos densos 27B+.
  • Apenas 4 modelos estão na fronteira de Pareto de throughput vs qualidade - Todos são da arquitetura LFM2-8B-A1B (MoE da LiquidAI com 1B parâmetros ativos). O design MoE significa que apenas cerca de 1B parâmetros estão ativos por token, alcançando 12-20 tokens/segundo, enquanto modelos densos 8B atingem no máximo 5-7 tokens/segundo.
  • A escalabilidade de contexto de 1k para 4k é plana - A maioria dos modelos mostra degradação zero de throughput, com algumas variantes LFM2 realmente acelerando em contexto de 4k.
  • A escalabilidade de concorrência é ruim (0,57x na concorrência 2 vs ideal 2,0x) - O Mac Mini é limitado pela largura de banda da memória, portanto, recomenda-se executar uma solicitação por vez.
Ad

Modelos da Fronteira de Pareto

Estes quatro modelos superam todos os outros em velocidade e qualidade:

  • LFM2-8B-A1B-Q5_K_M (unsloth): 14,24 TPS média, pontuação de qualidade 44,6
  • LFM2-8B-A1B-Q8_0 (unsloth): 12,37 TPS média, pontuação de qualidade 46,2
  • LFM2-8B-A1B-UD-Q8_K_XL (unsloth): 12,18 TPS média, pontuação de qualidade 47,9
  • LFM2-8B-A1B-Q8_0 (LiquidAI): 12,18 TPS média, pontuação de qualidade 51,2

A avaliação de qualidade usou subconjuntos compactos (20 questões GSM8K + 60 questões MMLU) - útil direcionalmente para classificação, mas não números absolutos de nível de publicação.

Recomendações

Para melhor qualidade: LFM2-8B-A1B-Q8_0. Para velocidade: Q5_K_M. Para equilíbrio: UD-Q6_K_XL.

Detalhes Técnicos

  • Hardware: Mac Mini M4, 16GB de memória unificada, macOS 15.x
  • Software: llama-server (llama.cpp)
  • Metodologia: Os números de throughput são p50 em múltiplas solicitações
  • Dados: Todos os dados são reproduzíveis a partir de artefatos no repositório

O pipeline completo é automatizado e de código aberto. Dados CSV com todos os 88 modelos e scripts de benchmark estão disponíveis no repositório.

📖 Leia a fonte completa: r/LocalLLaMA

Ad

👀 See Also

Rascunho do Encontro Qwen: Harness de Chamada de Funções 2 Aumenta Conformidade CoT de 9,91% para 100% por meio de Esquemas Estruturados
Tools

Rascunho do Encontro Qwen: Harness de Chamada de Funções 2 Aumenta Conformidade CoT de 9,91% para 100% por meio de Esquemas Estruturados

Uma continuação do post anterior sobre o harness de function-calling estende o padrão para domínios sem um compilador (memorandos de investimento, pareceres jurídicos, prontuários clínicos). O schema exige campos obrigatórios — a submissão é rejeitada se incompleta. Qwen3.6-27b atinge 100% de conformidade CoT nesses schemas.

OpenClawRadar
Benchmark de Criatividade Humana: Separando Convergência de Divergência na Avaliação Criativa de IA
Tools

Benchmark de Criatividade Humana: Separando Convergência de Divergência na Avaliação Criativa de IA

Contra Labs apresenta o Human Creativity Benchmark (HCB), uma estrutura que distingue critérios objetivamente verificáveis (ex.: aderência ao prompt) do gosto subjetivo (ex.: apelo visual) na avaliação de IA generativa para trabalho criativo. O benchmark revela que nenhum modelo atual é confiavelmente correto e orientável, abordando o colapso de modo e a necessidade de saída diferenciada.

OpenClawRadar
A ferramenta de correção de memória do OpenClaw resolve a degradação de desempenho.
Tools

A ferramenta de correção de memória do OpenClaw resolve a degradação de desempenho.

Um novo comando de barra chamado /claw_memory_fix ajuda a limpar arquivos de memória do OpenClaw quando o agente esquece credenciais ou permissões. A ferramenta implementa técnicas da Alibaba, engenharia do GitHub, MemGPT e pesquisas de janeiro de 2026 sobre gerenciamento de memória.

OpenClawRadar
Configurações Ephemeral OpenClaw com isolamento de rede e desmontagem automática
Tools

Configurações Ephemeral OpenClaw com isolamento de rede e desmontagem automática

Uma configuração que inicializa o OpenClaw dentro de uma VM efêmera com uma lista de permissões de saída de rede, injeta chaves de API em armazenamento baseado em RAM e inclui uma autodestruição de 2 horas. Todas as chamadas de LLM são registradas no SQLite para reprodução.

OpenClawRadar