Leistungstipp: Lokalen Modell-VRAM/RAM mit LimitMEMLOCK=infinity sperren

✍️ OpenClawRadar📅 Veröffentlicht: 16. September 2026🔗 Source
Ad

Wenn Ihr lokales Modell in Ihren kombinierten VRAM und RAM passt, können Sie den Speicher des Modellanbieters resident halten, indem Sie LimitMEMLOCK=infinity unter der [Service]-Kopfzeile der systemd-Unit für Ihren Anbieter hinzufügen. Der Kernel hört dann auf, Modellgewichte auf die Festplatte auszulagern, was die Hauptursache für Verlangsamungen ist, sobald ein Modell geladen ist.

Die Unit-Datei

In r/openclaw als funktionierendes Beispiel für LM Studio gepostet (passen Sie die Pfade und Benutzernamen an Ihre Installation an):

[Unit]
Description=LM Studio Server
RequiresMountsFor=/home

[Service] LimitMEMLOCK=infinity Type=oneshot RemainAfterExit=yes User=******** Environment="HOME=/home/" ExecStartPre=/home//.lmstudio/bin/lms daemon up ExecStartPre=/home//.lmstudio/bin/lms load text-embedding-bge-large-en-v1.5 --yes ExecStartPre=/home//.lmstudio/bin/lms load qwen3.6-35b-a3b-uncensored-hauhaucs-aggressive --yes ExecStart=/home//.lmstudio/bin/lms server start ExecStop=/home//.lmstudio/bin/lms daemon down

[Install] WantedBy=multi-user.target

Ad

Was jeder Teil bewirkt

  • LimitMEMLOCK=infinity — hebt die standardmäßige mlock-Obergrenze pro Prozess auf, sodass das geladene Modell aus Swap/Paging herausgehalten werden kann.
  • ExecStartPre mit lms daemon up — startet den LM Studio-Daemon vor allem anderen.
  • lms load <model> --yes — lädt jedes Modell beim Dienststart vor. Das Beispiel lädt ein Embedding-Modell (text-embedding-bge-large-en-v1.5) und ein Chat-Modell (qwen3.6-35b-a3b-uncensored-hauhaucs-aggressive).
  • lms server start als ExecStart — startet den OpenAI-kompatiblen Server.
  • lms daemon down als ExecStop — räumt beim Herunterfahren auf.
  • RequiresMountsFor=/home — stellt sicher, dass die Home-Partition mit den Modelldateien vor dem Dienststart eingebunden ist.
  • Type=oneshot + RemainAfterExit=yes — die Unit gilt nach Abschluss der Startbefehle als aktiv, was zu einem Daemon passt, der von der lms-CLI separat verwaltet wird.

Vorbehalt

Der Tipp setzt ausdrücklich voraus, dass das Modell in VRAM+RAM passt. Wenn nicht, ist das Sperren von Speicher der falsche Hebel — Sie verlagern das Problem nur woanders hin. Sobald es passt, besteht der Gewinn darin, Paging-bedingte Verzögerungen bei der Inferenz zu vermeiden.

Zum Anwenden: Fügen Sie den Block in Ihre Unit-Datei ein, dann systemctl daemon-reload und starten Sie den Dienst neu. Entwickler, die LM Studio headless als systemd-Dienst betreiben, sind hier die Zielgruppe; dieselbe Idee gilt für jeden Anbieterprozess, dessen Gewichte Sie im Speicher halten möchten.

📖 Lesen Sie die vollständige Quelle: r/openclaw

Ad

👀 Siehe auch