Executando o Google Gemma 4 26B-A4B Localmente com LM Studio 0.4.0 Headless CLI

O que o LM Studio 0.4.0 Adiciona para IA Local
O LM Studio 0.4.0 muda fundamentalmente a arquitetura ao extrair o motor de inferência principal para o llmster, um servidor independente. Isso permite executar o LM Studio inteiramente pela linha de comando usando o novo CLI lms, eliminando a necessidade da interface gráfica. A atualização o torna utilizável em servidores sem interface, em pipelines de CI/CD, sessões SSH ou para desenvolvedores focados no terminal.
Principais Recursos na Versão 0.4.0
- Daemon llmster: Um serviço em segundo plano que gerencia o carregamento e a inferência de modelos sem o aplicativo desktop
- CLI lms: Interface completa de linha de comando para baixar, carregar, conversar e servir modelos
- Processamento paralelo de solicitações: Agrupamento contínuo em vez de enfileiramento sequencial, permitindo que múltiplas solicitações ao mesmo modelo sejam executadas simultaneamente
- API REST com estado: Um novo endpoint /v1/chat que mantém o histórico da conversa entre solicitações
- Integração MCP: Suporte ao Model Context Protocol local com controle por chave de permissão
Por que o Gemma 4 26B-A4B para Uso Local
O Gemma 4 26B-A4B do Google usa uma arquitetura de mistura de especialistas com 128 especialistas mais 1 especialista compartilhado, mas ativa apenas 8 especialistas (3,8 bilhões de parâmetros) por token. Isso significa que ele roda bem em hardware que não suportaria um modelo denso de 26B. Em um MacBook Pro M4 Pro de 14" com 48GB de memória unificada, ele se encaixa confortavelmente e gera a 51 tokens/segundo.
O modelo pontua 82,6% no MMLU Pro e 88,3% no AIME 2026, próximo da variante densa de 31B (85,2% e 89,2%) enquanto roda significativamente mais rápido. Ele alcança uma pontuação Elo de ~1441, competindo com modelos como o Qwen 3.5 397B-A17B (~1450 Elo) que exigem 100-600B de parâmetros totais.
Principais capacidades incluem contexto máximo de 256K, suporte a visão para análise de capturas de tela e diagramas, chamada nativa de funções/ferramentas e raciocínio com modos de pensamento configuráveis.
Configuração Prática
O artigo percorre a instalação do CLI lms e a configuração do Gemma 4 26B-A4B para inferência local que pode ser usada com o Claude Code. O autor observa desacelerações significativas quando usado dentro do Claude Code em sua experiência.
📖 Leia a fonte completa: HN AI Agents
👀 See Also

Brainstorm MCP Server Permite que o Claude Consulte Outros LLMs para Obter Respostas Melhores
Um desenvolvedor criou um servidor MCP que permite ao Claude Code consultar outros modelos de IA como GPT-5.2 e DeepSeek antes de fornecer respostas. Os modelos participam de debates em múltiplas rodadas onde leem as respostas uns dos outros, discordam e refinam posições para convergir em soluções melhores.

Chamada de Agente: Deixe o Claude Code Participar de Chamadas do Google Meet, Zoom ou Teams como um Colega de Equipe
O AgentCall.dev conecta sua sessão existente do Claude Code, Codex ou Cursor ao Google Meet, Teams ou Zoom com voz, compartilhamento de tela e chat — sem captura de área de trabalho, sem dados de terceiros no modo direto.

Terminal CRM Local com Servidor MCP Integrado para Conexão com Claude
Um desenvolvedor criou um CRM pessoal que roda no terminal com armazenamento local em SQLite e inclui um servidor MCP integrado, dando ao Claude acesso a 18 ferramentas para gerenciar contatos, negócios e acompanhamentos.

Claude adiciona recurso de importação de memória para migrar de outros provedores de IA
O Claude agora permite que os usuários importem contexto e preferências de outros provedores de IA através de um processo de copiar e colar. O recurso de memória está disponível em todos os planos pagos e ajuda a manter o histórico de conversas ao alternar entre plataformas.