GLM 5 no Mac M3: Observações de Desempenho para Codificação Autônoma

✍️ OpenClawRadar📅 Publicado: February 23, 2026🔗 Source
GLM 5 no Mac M3: Observações de Desempenho para Codificação Autônoma
Ad

Benchmarks de Desempenho e Limitações

Um desenvolvedor testou o GLM 5 usando quantização 4-bit do MLX em um Mac M3 com 512GB de RAM para tarefas de codificação agentica. O modelo é descrito como "bastante utilizável" com o contexto mantido abaixo de aproximadamente 50.000 tokens, embora significativamente mais lento do que soluções baseadas em API como o Claude, especialmente durante o processamento de prompts.

O desempenho se degrada substancialmente quando o contexto excede 50 mil tokens. Em um teste processando 65 mil tokens, a primeira metade foi concluída em 8 minutos (67 tokens/segundo), enquanto a segunda metade levou 18 minutos adicionais, resultando em uma taxa geral de 41 tokens/segundo. A geração de tokens permanece mais rápida, estimada em 12-20 tokens/segundo em tamanhos de contexto maiores.

Observações de Fluxo de Trabalho

O usuário observa que o Opencode (o sistema de codificação agentica) lida com a geração de código em múltiplos arquivos de forma eficiente uma vez que um plano é criado, produzindo "milhares de tokens de código em vários arquivos em apenas alguns minutos com raciocínio entre eles". O processamento de prompts normalmente leva "alguns minutos" para ler algumas centenas de linhas de código por arquivo, com cerca de 10 minutos no total distribuídos entre sessões de planejamento.

A compactação no Opencode "realmente leva um tempo, pois basicamente reprocessa todo o contexto". Com um limite de contexto de 50 mil tokens, a compactação leva aproximadamente 5 minutos.

Ad

Configuração Técnica e Expectativas Futuras

O teste foi conduzido usando o LM Studio, que pode não fornecer as otimizações de runtime mais recentes. O usuário sugere que "o MLX ou mesmo o GGUF podem obter processamento de prompts mais rápido à medida que os runtimes são atualizados para o GLM 5, mas provavelmente não ficarão MUITO mais rápidos do que isso".

A configuração não é recomendada para tarefas que exigem 70 mil+ tokens no contexto devido tanto às limitações de tamanho de contexto quanto à "lentidão insuportável" que ocorre após exceder certos limites durante o processamento de prompts.

📖 Leia a fonte completa: r/LocalLLaMA

Ad

👀 See Also

NVIDIA anuncia plataforma de agente NemoClaw com controles de privacidade
Tools

NVIDIA anuncia plataforma de agente NemoClaw com controles de privacidade

A NVIDIA lançou o NemoClaw, uma plataforma de agentes que permite aos usuários instalar modelos Nimotron e o runtime Open Shell com um único comando, adicionando controles de privacidade e segurança para agentes autônomos.

OpenClawRadar
Claude Code user constrói plugin nvm para capturar contexto de resolução de problemas
Tools

Claude Code user constrói plugin nvm para capturar contexto de resolução de problemas

Um desenvolvedor criou um plugin do Claude chamado nvm (memória não volátil) que converte o histórico de sessões do Claude em cartões markdown documentando decisões de resolução de problemas e insights reutilizáveis. A ferramenta aborda o problema de perder o rastro de como os problemas foram resolvidos ao usar assistentes de codificação com IA.

OpenClawRadar
Habilidade OpenClaw Janitor para Gerenciamento Automatizado de Sistemas e Fortalecimento de Segurança
Tools

Habilidade OpenClaw Janitor para Gerenciamento Automatizado de Sistemas e Fortalecimento de Segurança

Um desenvolvedor criou uma habilidade que usa o Claude Code para acessar via SSH máquinas OpenClaw e fortalcer configurações, incluindo sandboxing, higiene do sistema operacional e segurança de canais, mantendo uma pasta de projeto com instruções de auditoria em CLAUDE.md.

OpenClawRadar
Design Aberto: Alternativa Open-Source ao Claude Design Roda em Seus Agentes CLI Locais
Tools

Design Aberto: Alternativa Open-Source ao Claude Design Roda em Seus Agentes CLI Locais

Open Design é um motor de design local-first e BYOK que transforma 11 CLIs de agentes de codificação (Claude Code, Codex, Cursor, Gemini CLI, etc.) em um fluxo de trabalho de design com 72 sistemas de design de nível profissional e 31 habilidades componíveis, exportando HTML/PDF/PPTX/MP4.

OpenClawRadar