Interface de chatbot de página única para executar localmente o Gemma 4 26B A4B

Um desenvolvedor criou uma interface de chatbot em página única HTML projetada para funcionar com o Gemma 4 26B A4B rodando localmente. A implementação se conecta à API do LM Studio e fornece uma interface completa de chatbot em um único arquivo HTML.
Implementação Técnica
O sistema executa o Gemma 4 26B A4B localmente com uma janela de contexto de 32K, alcançando 50-65 tokens por segundo. O modelo é distribuído entre duas GPUs: uma 7900 XT e uma 3060 Ti.
Recursos da Interface
- Suporte completo a streaming para respostas em tempo real
- Renderização de Markdown para saída formatada
- Seletor de modelo para alternar entre modelos disponíveis
- Seis controles deslizantes de parâmetros para ajustar o comportamento do modelo
- Edição de mensagens com capacidade de ramificação do histórico
- Função de regeneração para recriar respostas
- Botão de abortar para interromper a geração durante o streaming
- Suporte a prompt do sistema para instruções personalizadas
Detalhes de Desenvolvimento
O desenvolvedor observa que o Claude foi usado para corrigir dois bugs de DOM que o Gemma não conseguiu resolver. Todo o restante do trabalho de desenvolvimento foi concluído usando o Gemma 4. O projeto está disponível no GitHub para exame e uso.
Esse tipo de interface de página única é particularmente útil para desenvolvedores que trabalham com LLMs locais e desejam uma interface de chat leve e personalizável sem a complexidade de aplicações web elaboradas. A integração com a API do LM Studio a torna compatível com vários modelos locais além do Gemma.
📖 Read the full source: r/LocalLLaMA
👀 See Also

Google Surf MCP: MCP de Pesquisa Google Gratuito com Manipulação de PDF e Extração em Camadas
Google Surf MCP é um servidor MCP gratuito para pesquisa no Google e extração de URLs que lida com PDFs e oferece um modo de extração em camadas (resumo/completo) para economizar tokens.

SlackClaw: Instância Gerenciada do OpenClaw para Integração com Slack
SlackClaw é um produto comercial baseado no OpenClaw que fornece uma instância gerenciada especificamente para o Slack. Oferece instalação com um clique, conexões de ferramentas OAuth, servidores dedicados por espaço de trabalho e memória persistente.

O Método de Quantização JANG Melhora o Desempenho do MLX para Modelos Grandes
Um novo método de quantização chamado JANG permite executar modelos grandes como MiniMax-M2.5 e Qwen 3.5 no framework MLX da Apple com desempenho significativamente melhor do que a quantização padrão do MLX, alcançando velocidades quase nativas enquanto mantém uma precisão comparável a quantizações de bits mais altos.

Tilde.run: Uma Sandbox de Agentes com um Sistema de Arquivos Transacional e Versionado
O Tilde.run oferece sandboxes isoladas e reversíveis para agentes de IA, com um sistema de arquivos versionado que monta GitHub, S3 e Google Drive, e isolamento de rede por padrão.