Interfaz de chatbot de una sola página para ejecutar localmente Gemma 4 26B A4B

Un desarrollador ha creado una interfaz de chatbot de una sola página HTML diseñada para funcionar con Gemma 4 26B A4B ejecutándose localmente. La implementación se conecta a la API de LM Studio y proporciona una interfaz de chatbot completa en un solo archivo HTML.
Implementación Técnica
El sistema ejecuta Gemma 4 26B A4B localmente con una ventana de contexto de 32K, logrando 50-65 tokens por segundo. El modelo está distribuido entre dos GPUs: una 7900 XT y una 3060 Ti.
Características de la Interfaz
- Soporte completo de transmisión para respuestas en tiempo real
- Renderizado de Markdown para salida formateada
- Selector de modelos para cambiar entre modelos disponibles
- Seis controles deslizantes de parámetros para ajustar el comportamiento del modelo
- Edición de mensajes con capacidades de bifurcación del historial
- Función de regenerar para regenerar respuestas
- Botón de abortar para detener la generación durante la transmisión
- Soporte de instrucciones personalizadas mediante prompts del sistema
Detalles de Desarrollo
El desarrollador señala que se utilizó Claude para corregir dos errores del DOM que Gemma no pudo resolver. Todo el resto del trabajo de desarrollo se completó utilizando Gemma 4. El proyecto está disponible en GitHub para su examen y uso.
Este tipo de interfaz de una sola página es particularmente útil para desarrolladores que trabajan con LLMs locales y desean una interfaz de chat liviana y personalizable sin la complejidad de aplicaciones web complejas. La integración con la API de LM Studio la hace compatible con varios modelos locales más allá de solo Gemma.
📖 Read the full source: r/LocalLLaMA
👀 Ver también

Qwen 3.6 27B alcanza una velocidad 2.5 veces mayor con decodificación especulativa MTP en llama.cpp
Un usuario de Reddit reporta inferencia 2.5 veces más rápida en Qwen 3.6 27B usando decodificación especulativa MTP con un PR personalizado de llama.cpp, alcanzando 28 tok/s en Mac M2 Max 96GB. Incluye cuantizaciones GGUF preconvertidas y plantillas de chat corregidas.

Matriz LLM: Comparaciones de Modelos Votados por la Comunidad Construida con Claude Code
Un científico de datos creó llm-matrix.vercel.app para comparar puntuaciones de LLM en múltiples dimensiones simultáneamente, con votos de la comunidad que moldean las clasificaciones. El sitio fue desarrollado completamente usando Claude Code con dos complementos específicos.

Claude Code Hook Monitorea la Acumulación de WIP en los Flujos de Trabajo de Codificación con IA
Un desarrollador creó un gancho UserPromptSubmit para Claude Code que muestra la acumulación de trabajo en progreso en cuatro colas: cambios sin confirmar de más de 200 líneas, tres o más confirmaciones sin enviar, confirmaciones enviadas sin archivos de conjunto de cambios y PRs de lanzamiento abiertos por más de 24 horas.

Sentinel: Plataforma de Agentes Autohospedados para Suscriptores de Claude Code
Sentinel es una plataforma de agentes gratuita y de código abierto que se ejecuta directamente en su token OAuth de Claude Code existente sin sobrecarga de API. Proporciona una interfaz de operador limpia con automatización de navegador en tiempo real a través de VNC integrado e incluye funciones como control de Git, registros de seguimiento de sesiones y memoria jerárquica estructurada.