Dica de desempenho: bloqueie a VRAM/RAM do modelo local com LimitMEMLOCK=infinity

✍️ OpenClawRadar📅 Publicado: September 16, 2026🔗 Source
Ad

Se o seu modelo local couber na soma da VRAM com a RAM, você pode manter a memória do provedor do modelo residente adicionando LimitMEMLOCK=infinity sob o cabeçalho [Service] da unit systemd do seu provedor. O kernel então para de paginar os pesos do modelo para o disco, que é a origem da maior parte das lentidões depois que um modelo é carregado.

O arquivo da unit

Postado no r/openclaw como exemplo funcional para o LM Studio (edite os caminhos e nomes de usuário para corresponder à sua instalação):

[Unit]
Description=LM Studio Server
RequiresMountsFor=/home

[Service] LimitMEMLOCK=infinity Type=oneshot RemainAfterExit=yes User=******** Environment="HOME=/home/" ExecStartPre=/home//.lmstudio/bin/lms daemon up ExecStartPre=/home//.lmstudio/bin/lms load text-embedding-bge-large-en-v1.5 --yes ExecStartPre=/home//.lmstudio/bin/lms load qwen3.6-35b-a3b-uncensored-hauhaucs-aggressive --yes ExecStart=/home//.lmstudio/bin/lms server start ExecStop=/home//.lmstudio/bin/lms daemon down

[Install] WantedBy=multi-user.target

Ad

O que cada parte faz

  • LimitMEMLOCK=infinity — remove o limite padrão de mlock por processo, para que o modelo carregado possa ser mantido fora do swap/paginação.
  • ExecStartPre com lms daemon up — inicia o daemon do LM Studio antes de qualquer outra coisa.
  • lms load <model> --yes — pré-carrega cada modelo na inicialização do serviço. O exemplo carrega um modelo de embeddings (text-embedding-bge-large-en-v1.5) e um modelo de chat (qwen3.6-35b-a3b-uncensored-hauhaucs-aggressive).
  • lms server start como ExecStart — sobe o servidor compatível com OpenAI.
  • lms daemon down como ExecStop — limpa tudo ao desligar.
  • RequiresMountsFor=/home — garante que a partição home que contém os arquivos do modelo esteja montada antes de o serviço iniciar.
  • Type=oneshot + RemainAfterExit=yes — a unit é tratada como ativa depois que os comandos de inicialização terminam, o que se encaixa em um daemon gerenciado separadamente pela CLI lms.

Ressalva

A dica assume explicitamente que o modelo cabe na VRAM+RAM. Se não couber, travar a memória é a alavanca errada — você só vai empurrar o problema para outro lugar. Quando couber, o ganho é evitar travamentos induzidos por paginação durante a inferência.

Para aplicar: insira o bloco no seu arquivo de unit, depois execute systemctl daemon-reload e reinicie o serviço. Desenvolvedores que rodam o LM Studio headless como serviço systemd são o público-alvo aqui; a mesma ideia se aplica a qualquer processo de provedor cujos pesos você queira fixados na memória.

📖 Read the full source: r/openclaw

Ad

👀 See Also

OpenClaw: Se Sua Tarefa Não Sobrevive a uma Reinicialização, Ainda é uma Sessão de Chat
Tips

OpenClaw: Se Sua Tarefa Não Sobrevive a uma Reinicialização, Ainda é uma Sessão de Chat

Uma publicação no Reddit argumenta que tarefas do OpenClaw que dependem do histórico de conversa para estado não são retomáveis. Armazene identidade da tarefa, passo e estado de aprovação fora da transcrição.

OpenClawRadar
Como um não-programador criou um fluxo de trabalho reutilizável do Claude para marketing de conteúdo de fundador
Tips

Como um não-programador criou um fluxo de trabalho reutilizável do Claude para marketing de conteúdo de fundador

Um ex-editor de revista com zero experiência em programação compartilha como acidentalmente criou um fluxo de trabalho repetível com Claude para marketing de conteúdo de founder solo: despeje pensamentos crus e depois reestruture com Claude em formatos específicos para cada plataforma.

OpenClawRadar
Taxa de Aceitação MTP: Limiar de 50% Determina o Benefício da Decodificação Especulativa
Tips

Taxa de Aceitação MTP: Limiar de 50% Determina o Benefício da Decodificação Especulativa

MTP (Multi-Token Prediction) via decodificação especulativa no Gemma-4 26B mostra benefício apenas quando a taxa de aceitação do token candidato excede 50% — com base em benchmarks mlx-vlm no M4 Max Studio.

OpenClawRadar
Quatro arquivos locais para manter o contexto de Claude em projetos longos
Tips

Quatro arquivos locais para manter o contexto de Claude em projetos longos

Um usuário do Reddit recomenda manter quatro arquivos Markdown—claude.md, memory.md, restart.md e backlog.md—como memória externa para o Claude, a fim de contrabalançar a compressão da janela de contexto em conversas prolongadas.

OpenClawRadar