Exécuter Google Gemma 4 26B-A4B en local avec LM Studio 0.4.0 en mode CLI sans interface

✍️ OpenClawRadar📅 Publié: April 15, 2026🔗 Source
Exécuter Google Gemma 4 26B-A4B en local avec LM Studio 0.4.0 en mode CLI sans interface
Ad

Ce qu'apporte LM Studio 0.4.0 pour l'IA locale

LM Studio 0.4.0 modifie fondamentalement l'architecture en extrayant le moteur d'inférence principal dans llmster, un serveur autonome. Cela permet d'exécuter LM Studio entièrement depuis la ligne de commande en utilisant le nouveau CLI lms, éliminant le besoin de l'interface graphique. Cette mise à jour le rend utilisable sur des serveurs sans interface, dans des pipelines CI/CD, des sessions SSH, ou pour les développeurs axés sur le terminal.

Fonctionnalités clés de la version 0.4.0

  • Démon llmster : Un service en arrière-plan qui gère le chargement des modèles et l'inférence sans l'application de bureau
  • CLI lms : Interface complète en ligne de commande pour télécharger, charger, discuter et servir des modèles
  • Traitement parallèle des requêtes : Batching continu au lieu de la mise en file d'attente séquentielle, permettant à plusieurs requêtes vers le même modèle de s'exécuter simultanément
  • API REST avec état : Un nouveau point de terminaison /v1/chat qui conserve l'historique des conversations entre les requêtes
  • Intégration MCP : Prise en charge locale du protocole de contexte de modèle avec contrôle par clé d'autorisation
Ad

Pourquoi Gemma 4 26B-A4B pour un usage local

Gemma 4 26B-A4B de Google utilise une architecture de mélange d'experts avec 128 experts plus 1 expert partagé, mais n'active que 8 experts (3,8 milliards de paramètres) par token. Cela signifie qu'il fonctionne bien sur du matériel qui ne pourrait pas gérer un modèle dense de 26 milliards de paramètres. Sur un MacBook Pro M4 Pro 14 pouces avec 48 Go de mémoire unifiée, il s'installe confortablement et génère à 51 tokens/seconde.

Le modèle obtient 82,6 % sur MMLU Pro et 88,3 % sur AIME 2026, proche de la variante dense 31B (85,2 % et 89,2 %) tout en fonctionnant considérablement plus vite. Il atteint un score Elo d'environ 1441, rivalisant avec des modèles comme Qwen 3.5 397B-A17B (~1450 Elo) qui nécessitent 100 à 600 milliards de paramètres totaux.

Les capacités clés incluent un contexte maximum de 256K, la prise en charge de la vision pour analyser des captures d'écran et des diagrammes, l'appel natif de fonctions/outils, et le raisonnement avec des modes de pensée configurables.

Configuration pratique

L'article décrit l'installation du CLI lms et la configuration de Gemma 4 26B-A4B pour une inférence locale qui peut être utilisée avec Claude Code. L'auteur note des ralentissements significatifs lors de l'utilisation dans Claude Code d'après son expérience.

📖 Read the full source: HN AI Agents

Ad

👀 See Also

Miasma : Un outil pour piéger les robots d'indexation d'IA avec des données empoisonnées
Tools

Miasma : Un outil pour piéger les robots d'indexation d'IA avec des données empoisonnées

Miasma est un outil serveur qui envoie des données d'entraînement empoisonnées et des liens autoréférentiels aux aspirateurs web d'IA, créant une boucle sans fin. Il fonctionne avec une empreinte mémoire minimale et peut être configuré via des options CLI incluant le port, l'hôte et le préfixe de lien.

OpenClawRadar
altRAG : Remplacez la base de données vectorielle RAG par des fichiers pointeurs de 2 Ko pour les agents d'IA de codage
Tools

altRAG : Remplacez la base de données vectorielle RAG par des fichiers pointeurs de 2 Ko pour les agents d'IA de codage

altRAG est un outil Python qui remplace la RAG de base de données vectorielle par des fichiers de pointeurs légers. Il scanne les fichiers de compétences Markdown/YAML pour créer un fichier squelette de 2KB qui mappe les sections aux numéros de ligne exacts et aux décalages d'octets, permettant aux agents IA de lire uniquement les sections nécessaires au lieu des fichiers entiers.

OpenClawRadar
🦀
Tools

OpenClaw sur Android : un ordinateur IA privé de la taille d'un pouce exécute OpenClaw dans une machine virtuelle

Le PlugClaw de Trustkernel est une clé USB de la taille d'un pouce qui exécute Android et OpenClaw dans une VM dédiée, ajoutant un agent GUI pour interagir avec les applications Android sur n'importe quel téléphone ou ordinateur portable.

OpenClawRadar
ExposureGuard MCP Server ajoute l'analyse de sécurité des domaines à Claude Desktop
Tools

ExposureGuard MCP Server ajoute l'analyse de sécurité des domaines à Claude Desktop

Un développeur a créé un serveur MCP pour l'analyse de sécurité des domaines en utilisant Claude Code, exposant quatre outils qui vérifient SPF, DMARC, SSL, les en-têtes de sécurité, DNSSEC, les ports ouverts, MX et HTTPS. Le serveur est disponible via pip install exposureguard-mcp avec un niveau gratuit de 100 appels API par jour.

OpenClawRadar