Implementação do Agente Local OpenClaw com Cache TurboQuant para Hardware de Médio Porte

✍️ OpenClawRadar📅 Publicado: April 21, 2026🔗 Source
Implementação do Agente Local OpenClaw com Cache TurboQuant para Hardware de Médio Porte
Ad

A equipe do OpenClaw lançou um aplicativo de um clique que permite que modelos agentes locais rodem em hardware de médio porte como o MacBook Air com 16GB de RAM e o Mac Mini. A implementação aborda o desafio de executar modelos agentes sofisticados (como QWEN ou GLM) em hardware comum, incorporando compressão de cache TurboQuant e um processo de aquecimento de contexto.

Detalhes Técnicos da Implementação

A solução é baseada em vários componentes-chave:

  • Cache TurboQuant: Usa a implementação TurboQuant do llama.cpp de Tom Turney, que foi corrigida para funcionar corretamente com chamadas de ferramentas agentes em modelos QWEN.
  • Cache/Aquecimento de Contexto: Implementa um processo de "aquecimento" específico do OpenClaw que leva alguns minutos após a inicialização do modelo, mas permite o processamento suave de solicitações posteriormente em hardware limitado.
  • Suporte a Modelos: Testado com o modelo de raciocínio Gemma 4 do Google e o QWEN 3.5, ambos alcançando desempenho semelhante em máquinas M4 padrão.
Ad

Benchmarks de Desempenho

Com testes em um MacBook Air com 16GB de memória:

  • Velocidade de Processamento: Tanto o Gemma 4 quanto o QWEN 3.5 entregam aproximadamente 10-15 tokens por segundo (tps)
  • Comparação de Velocidade: O QWEN mostra um desempenho ligeiramente mais rápido que o Gemma 4
  • Desempenho de Raciocínio: Comparável entre os dois modelos, embora nenhum iguale os modelos da Anthropic para tarefas complexas ou programação
  • Comparação com Nuvem: As respostas são 2-3 vezes mais lentas que modelos poderosos na nuvem

Aplicações Práticas

A implementação torna os agentes locais viáveis para:

  • Tarefas cotidianas onde a velocidade não é crítica
  • Processos em segundo plano em hardware acessível (ex: Mac Mini de US$ 600)
  • Implantação de agentes locais 24/7 que podem se pagar em alguns meses

A equipe observa que, embora o desempenho de raciocínio ainda não iguale os modelos de nuvem de ponta para tarefas complexas, isso representa um passo significativo em direção à implantação prática de agentes locais em hardware de consumo.

📖 Leia a fonte completa: r/LocalLLaMA

Ad

👀 See Also

O Plugin HomeClaw Conecta o Apple HomeKit ao OpenClaw
Tools

O Plugin HomeClaw Conecta o Apple HomeKit ao OpenClaw

HomeClaw é um plugin do OpenClaw que conecta dispositivos Apple Home/HomeKit ao OpenClaw. Ele requer uma Conta de Desenvolvedor Apple para construir e executar devido às restrições do Apple HomeKit para distribuições notarizadas.

OpenClawRadar
Steelman R5: Modelo de 14B Ajustado Supera o Claude Opus na Geração de Código Ada
Tools

Steelman R5: Modelo de 14B Ajustado Supera o Claude Opus na Geração de Código Ada

Um desenvolvedor ajustou o Qwen2.5-Coder-14B-Instruct usando QLoRA em um conjunto de dados verificado por compilador com 3.430 pares de instruções Ada/SPARK, alcançando uma taxa de compilação de 68,6% em um benchmark personalizado, contra 42,1% do Claude Opus 4.6. O modelo está disponível via Ollama e cabe em 12GB de VRAM.

OpenClawRadar
Sessões Claude: Aplicativo Desktop Leve para Navegar no Histórico de Código do Claude
Tools

Sessões Claude: Aplicativo Desktop Leve para Navegar no Histórico de Código do Claude

Claude Sessions é um novo aplicativo de desktop que permite aos desenvolvedores navegar pelo histórico de sessões do Claude Code localmente. Ele lê de ~/.claude/projects, organiza sessões por projeto, lida com sessões grandes de até 500k+ tokens sem lentidão, e inclui funcionalidade de busca e navegação por teclado.

OpenClawRadar
Correção do Hook PreToolUse Resolve Problema de Travamento de Imagem de Código Claude
Tools

Correção do Hook PreToolUse Resolve Problema de Travamento de Imagem de Código Claude

Um desenvolvedor criou um hook PreToolUse que intercepta as chamadas de Leitura do Claude Code em imagens, converte-as com segurança e as redireciona através de um subprocesso Haiku para evitar falhas de API Error 400 causadas por imagens problemáticas.

OpenClawRadar