Otimizando o GLM-4.7-Flash no Mac Mini M4 com 24 GB de RAM

✍️ OpenClawRadar📅 Publicado: February 24, 2026🔗 Source
Otimizando o GLM-4.7-Flash no Mac Mini M4 com 24 GB de RAM
Ad

Configuração Prática para GLM-4.7-Flash no Hardware M4

Um desenvolvedor testando OpenClaw e Ollama em um Mac Mini M4 com 24GB de RAM compartilhou detalhes específicos de otimização para executar o modelo GLM-4.7-Flash. A fonte fornece realidades concretas de alocação de memória e parâmetros de configuração que funcionam dentro das limitações do hardware.

Realidade de Memória e Seleção de Modelo

Os testes revelam que o orçamento efetivo de memória GPU no M4 Mini é aproximadamente 17.8GB Metal (GPU-wired), não os 24GB completos. O restante é consumido pelo macOS, aplicativos e computação da CPU. Esta limitação afeta a seleção do modelo e o tamanho do contexto.

  • Quantização Q4_K_XL (17.5GB GGUF) não consegue lidar com contexto de 32k: Modelo (14.4GB) + KV (2.8GB) + computação (1.4GB) = 18.6GB → Sem Memória
  • Quantização Q3_K_XL (13.8GB GGUF) funciona em contexto de 32k: Modelo (12.7GB) + KV (3.2GB) + computação (1.4GB) = 16.1GB com 1.7GB de margem
  • O limite de contexto é aproximadamente 34k antes que ocorra falta de memória

Detalhes da Configuração

A configuração bem-sucedida utiliza:

  • Modelo: unsloth/GLM-4.7-Flash-GGUF do Hugging Face
  • Quantização: Q3_K_XL
  • Tamanho do contexto: 32k com MLA (Multi-Head Latent Attention)
  • Implementação do cache KV: cache KV sem v do llama.cpp (PR #19067, Jan 2026) acionado por metadados GGUF (key_length_mla, kv_lora_rank)
  • Requisito de compilação: llama.cpp b7860+

A implementação MLA reduz significativamente o uso de memória KV - o cache KV de contexto de 32k é apenas 3.2GB em vez de 13GB.

Ad

Considerações Específicas da Estrutura

Estruturas agentes como OpenClaw têm limiares de contexto internos que afetam o desempenho:

  • OpenClaw aciona compactação agressiva abaixo de 32k de contexto
  • Aumentar o contexto de 20k para 32k reduziu o tempo de inicialização de 5 minutos para 2 minutos e 17 segundos
  • As passagens de compactação caíram de 2 para 1 ao combinar num_ctx com os limiares da estrutura
  • num_ctx deve ser incorporado ao Modelfile do Ollama - OpenClaw e outros orquestradores que usam a API compatível com OpenAI do Ollama ignoram-no no nível da solicitação

Dados de Teste de Desempenho

O desenvolvedor forneceu dados de tempo específicos para várias tarefas:

Tarefa                     Tempo   Tokens de Entrada  Compactações  Resultado
Introdução de personalidade 119s   ~13,900      2            ✅
Recuperação de perfil       60s    13,247       2            ✅ com ressalva
Criação de tarefa           61s    13,375       2            ✅
Gravação de memória         165s   14,448       2            ✅
Recuperação de memória      89s    14,085       2            ✅
Busca web + síntese         273s   18,668       2            ✅

Considerações sobre MLX

O desenvolvedor observa que MLX e GGUF são formatos diferentes - arquivos GGUF Unsloth/bartowski não podem ser executados com mlx-lm. Atualmente, não existe nenhum modelo Flash de 3 bits no repositório mlx-community, apenas modelos de 4 bits estão disponíveis.

📖 Leia a fonte completa: r/openclaw

Ad

👀 See Also

Conselhos Práticos de Arquitetura de Sistemas Multiagentes Baseados na Experiência
Guides

Conselhos Práticos de Arquitetura de Sistemas Multiagentes Baseados na Experiência

Um desenvolvedor compartilha cinco padrões específicos para construir sistemas de IA multiagente com base na experiência de executar um sistema diário de 7 agentes: comece com um agente, use o padrão orquestrador, implemente memória compartilhada com arquivos JSON, direcione modelos por tarefa e adicione loops de confirmação.

OpenClawRadar
Correções de Chamada de Ferramentas do Qwen 3.5 para Uso Agente: Status do Servidor e Soluções Alternativas no Lado do Cliente
Guides

Correções de Chamada de Ferramentas do Qwen 3.5 para Uso Agente: Status do Servidor e Soluções Alternativas no Lado do Cliente

Uma análise detalhada identifica quatro bugs que quebram a chamada de ferramentas do Qwen 3.5 em configurações agentes, acompanha correções de servidor até abril de 2026 e fornece uma função Python do lado do cliente para analisar chamadas de ferramentas XML quando os servidores falham.

OpenClawRadar
Configuração de Instância Canary para Atualizações Seguras do OpenClaw
Guides

Configuração de Instância Canary para Atualizações Seguras do OpenClaw

Um usuário do Reddit compartilha uma metodologia detalhada de canário para testar atualizações do OpenClaw antes da produção: raiz de configuração isolada, porta separada, matriz de teste de fumaça e um formato de relatório de atualização estruturado.

OpenClawRadar
30 dias de Claude para negócios freelance: 5 prompts que funcionam
Guides

30 dias de Claude para negócios freelance: 5 prompts que funcionam

Um freelancer testou o Claude diariamente por 30 dias e compartilha 5 prompts que reduziram a escrita de propostas de 45 para 5 minutos, aumentaram as taxas em 30% sem nenhuma objeção e triplicaram a taxa de resposta de pitches frios.

OpenClawRadar