Executando o Google Gemma 4 26B-A4B Localmente com LM Studio 0.4.0 Headless CLI

✍️ OpenClawRadar📅 Publicado: April 15, 2026🔗 Source
Executando o Google Gemma 4 26B-A4B Localmente com LM Studio 0.4.0 Headless CLI
Ad

O que o LM Studio 0.4.0 Adiciona para IA Local

O LM Studio 0.4.0 muda fundamentalmente a arquitetura ao extrair o motor de inferência principal para o llmster, um servidor independente. Isso permite executar o LM Studio inteiramente pela linha de comando usando o novo CLI lms, eliminando a necessidade da interface gráfica. A atualização o torna utilizável em servidores sem interface, em pipelines de CI/CD, sessões SSH ou para desenvolvedores focados no terminal.

Principais Recursos na Versão 0.4.0

  • Daemon llmster: Um serviço em segundo plano que gerencia o carregamento e a inferência de modelos sem o aplicativo desktop
  • CLI lms: Interface completa de linha de comando para baixar, carregar, conversar e servir modelos
  • Processamento paralelo de solicitações: Agrupamento contínuo em vez de enfileiramento sequencial, permitindo que múltiplas solicitações ao mesmo modelo sejam executadas simultaneamente
  • API REST com estado: Um novo endpoint /v1/chat que mantém o histórico da conversa entre solicitações
  • Integração MCP: Suporte ao Model Context Protocol local com controle por chave de permissão
Ad

Por que o Gemma 4 26B-A4B para Uso Local

O Gemma 4 26B-A4B do Google usa uma arquitetura de mistura de especialistas com 128 especialistas mais 1 especialista compartilhado, mas ativa apenas 8 especialistas (3,8 bilhões de parâmetros) por token. Isso significa que ele roda bem em hardware que não suportaria um modelo denso de 26B. Em um MacBook Pro M4 Pro de 14" com 48GB de memória unificada, ele se encaixa confortavelmente e gera a 51 tokens/segundo.

O modelo pontua 82,6% no MMLU Pro e 88,3% no AIME 2026, próximo da variante densa de 31B (85,2% e 89,2%) enquanto roda significativamente mais rápido. Ele alcança uma pontuação Elo de ~1441, competindo com modelos como o Qwen 3.5 397B-A17B (~1450 Elo) que exigem 100-600B de parâmetros totais.

Principais capacidades incluem contexto máximo de 256K, suporte a visão para análise de capturas de tela e diagramas, chamada nativa de funções/ferramentas e raciocínio com modos de pensamento configuráveis.

Configuração Prática

O artigo percorre a instalação do CLI lms e a configuração do Gemma 4 26B-A4B para inferência local que pode ser usada com o Claude Code. O autor observa desacelerações significativas quando usado dentro do Claude Code em sua experiência.

📖 Leia a fonte completa: HN AI Agents

Ad

👀 See Also

Claude Code HUD: Painel de Terminal para Monitoramento de Sessões de Codificação com IA
Tools

Claude Code HUD: Painel de Terminal para Monitoramento de Sessões de Codificação com IA

claude-code-hud é um painel de terminal que fornece monitoramento em tempo real para sessões do Claude Code, mostrando o uso da janela de contexto, limites de taxa da API e alterações de arquivos sem exigir uma IDE. Execute-o com npx claude-code-hud.

OpenClawRadar
SDK do Microsoft Teams Adiciona Adaptador de Servidor HTTP para Agentes de IA Existentes
Tools

SDK do Microsoft Teams Adiciona Adaptador de Servidor HTTP para Agentes de IA Existentes

O SDK do Microsoft Teams agora inclui um adaptador de servidor HTTP que permite que desenvolvedores conectem agentes de IA existentes ao Teams sem reescrever seu código. Ele funciona com cadeias LangChain, bots Slack e implantações Azure Foundry ao injetar um endpoint POST /api/messages em servidores Express existentes.

OpenClawRadar
Sistema Multi-Agente para Análise Competitiva Aprofundada com Claude
Tools

Sistema Multi-Agente para Análise Competitiva Aprofundada com Claude

Um desenvolvedor criou um sistema de agentes em três ondas que vai além de listas superficiais de concorrentes para extrair inteligência de preços, padrões de sentimento do cliente e sinais estratégicos por meio de pesquisa estruturada de múltiplas fontes.

OpenClawRadar
Desenvolvedor Cria Compilador Scheme para WASM Usando IA em 4 Dias
Tools

Desenvolvedor Cria Compilador Scheme para WASM Usando IA em 4 Dias

Um desenvolvedor criou o Puppy Scheme, um compilador Scheme que gera código WebAssembly, em cerca de 4 dias com assistência de IA. O compilador suporta 73% dos padrões R5RS e R7RS, utiliza WASM GC e alcançou melhorias no tempo de compilação de 3½ minutos para 11 segundos durante a noite.

OpenClawRadar