Exécuter Google Gemma 4 26B-A4B en local avec LM Studio 0.4.0 en mode CLI sans interface

✍️ OpenClawRadar📅 Publié: April 15, 2026🔗 Source
Exécuter Google Gemma 4 26B-A4B en local avec LM Studio 0.4.0 en mode CLI sans interface
Ad

Ce qu'apporte LM Studio 0.4.0 pour l'IA locale

LM Studio 0.4.0 modifie fondamentalement l'architecture en extrayant le moteur d'inférence principal dans llmster, un serveur autonome. Cela permet d'exécuter LM Studio entièrement depuis la ligne de commande en utilisant le nouveau CLI lms, éliminant le besoin de l'interface graphique. Cette mise à jour le rend utilisable sur des serveurs sans interface, dans des pipelines CI/CD, des sessions SSH, ou pour les développeurs axés sur le terminal.

Fonctionnalités clés de la version 0.4.0

  • Démon llmster : Un service en arrière-plan qui gère le chargement des modèles et l'inférence sans l'application de bureau
  • CLI lms : Interface complète en ligne de commande pour télécharger, charger, discuter et servir des modèles
  • Traitement parallèle des requêtes : Batching continu au lieu de la mise en file d'attente séquentielle, permettant à plusieurs requêtes vers le même modèle de s'exécuter simultanément
  • API REST avec état : Un nouveau point de terminaison /v1/chat qui conserve l'historique des conversations entre les requêtes
  • Intégration MCP : Prise en charge locale du protocole de contexte de modèle avec contrôle par clé d'autorisation
Ad

Pourquoi Gemma 4 26B-A4B pour un usage local

Gemma 4 26B-A4B de Google utilise une architecture de mélange d'experts avec 128 experts plus 1 expert partagé, mais n'active que 8 experts (3,8 milliards de paramètres) par token. Cela signifie qu'il fonctionne bien sur du matériel qui ne pourrait pas gérer un modèle dense de 26 milliards de paramètres. Sur un MacBook Pro M4 Pro 14 pouces avec 48 Go de mémoire unifiée, il s'installe confortablement et génère à 51 tokens/seconde.

Le modèle obtient 82,6 % sur MMLU Pro et 88,3 % sur AIME 2026, proche de la variante dense 31B (85,2 % et 89,2 %) tout en fonctionnant considérablement plus vite. Il atteint un score Elo d'environ 1441, rivalisant avec des modèles comme Qwen 3.5 397B-A17B (~1450 Elo) qui nécessitent 100 à 600 milliards de paramètres totaux.

Les capacités clés incluent un contexte maximum de 256K, la prise en charge de la vision pour analyser des captures d'écran et des diagrammes, l'appel natif de fonctions/outils, et le raisonnement avec des modes de pensée configurables.

Configuration pratique

L'article décrit l'installation du CLI lms et la configuration de Gemma 4 26B-A4B pour une inférence locale qui peut être utilisée avec Claude Code. L'auteur note des ralentissements significatifs lors de l'utilisation dans Claude Code d'après son expérience.

📖 Read the full source: HN AI Agents

Ad

👀 See Also

Definable AI ajoute un tableau de bord d'observabilité auto-hébergé avec un seul indicateur.
Tools

Definable AI ajoute un tableau de bord d'observabilité auto-hébergé avec un seul indicateur.

Definable AI, un framework Python open-source pour construire des agents d'IA, inclut désormais un tableau de bord d'observabilité intégré qui peut être activé avec un seul indicateur. Le tableau de bord fournit un streaming d'événements en temps réel, une comptabilité des tokens, des métriques de latence et une relecture d'exécution sans dépendances externes.

OpenClawRadar
Cadre d'Équipe de Recherche en Boîte pour Claude Code Utilisant une Architecture Multi-Agents
Tools

Cadre d'Équipe de Recherche en Boîte pour Claude Code Utilisant une Architecture Multi-Agents

Un développeur a créé un cadre de recherche multi-agents pour Claude Code qui utilise Opus 4.6 pour coordonner des agents spécialisés via un plugin appelé research-clab. Le cadre se déploie via un processus guidé de questions-réponses et comprend 11 compétences, des définitions d'agents et des répertoires structurés pour gérer des projets de recherche complexes.

OpenClawRadar
Echo-TTS Porté sur Apple Silicon avec MLX pour une Synthèse Vocale Native avec Clonage de Voix
Tools

Echo-TTS Porté sur Apple Silicon avec MLX pour une Synthèse Vocale Native avec Clonage de Voix

Echo-TTS, un modèle de synthèse vocale par diffusion de 2,4 milliards de paramètres avec clonage vocal, a été adapté de CUDA pour fonctionner nativement sur les puces Apple de série M grâce à MLX. Sur un Mac mini M4 de base avec 16 Go de RAM, un clonage vocal de 5 secondes prend environ 10 secondes à générer, tandis que des clones de 30 secondes prennent environ 60 secondes.

OpenClawRadar
Zoku : Un outil qui détecte automatiquement les workflows répétés dans le code Claude
Tools

Zoku : Un outil qui détecte automatiquement les workflows répétés dans le code Claude

Zoku est un outil local qui se connecte au système d'événements de Claude Code pour enregistrer les actions des outils à travers les sessions, identifie les schémas de flux de travail répétés, puis informe Claude de ces schémas afin qu'il puisse les suggérer ou les exécuter de manière proactive. Il ne nécessite aucune configuration, n'a aucune dépendance et stocke tout localement dans ~/.zoku/.

OpenClawRadar