Interfaz de chatbot de una sola página para ejecutar localmente Gemma 4 26B A4B

Un desarrollador ha creado una interfaz de chatbot de una sola página HTML diseñada para funcionar con Gemma 4 26B A4B ejecutándose localmente. La implementación se conecta a la API de LM Studio y proporciona una interfaz de chatbot completa en un solo archivo HTML.
Implementación Técnica
El sistema ejecuta Gemma 4 26B A4B localmente con una ventana de contexto de 32K, logrando 50-65 tokens por segundo. El modelo está distribuido entre dos GPUs: una 7900 XT y una 3060 Ti.
Características de la Interfaz
- Soporte completo de transmisión para respuestas en tiempo real
- Renderizado de Markdown para salida formateada
- Selector de modelos para cambiar entre modelos disponibles
- Seis controles deslizantes de parámetros para ajustar el comportamiento del modelo
- Edición de mensajes con capacidades de bifurcación del historial
- Función de regenerar para regenerar respuestas
- Botón de abortar para detener la generación durante la transmisión
- Soporte de instrucciones personalizadas mediante prompts del sistema
Detalles de Desarrollo
El desarrollador señala que se utilizó Claude para corregir dos errores del DOM que Gemma no pudo resolver. Todo el resto del trabajo de desarrollo se completó utilizando Gemma 4. El proyecto está disponible en GitHub para su examen y uso.
Este tipo de interfaz de una sola página es particularmente útil para desarrolladores que trabajan con LLMs locales y desean una interfaz de chat liviana y personalizable sin la complejidad de aplicaciones web complejas. La integración con la API de LM Studio la hace compatible con varios modelos locales más allá de solo Gemma.
📖 Read the full source: r/LocalLLaMA
👀 Ver también

Tredict Servidor MCP Permite a Claude Crear y Enviar Planes de Entrenamiento a Relojes Deportivos
Un desarrollador creó un Servidor Tredict MCP para Claude.ai y Claude Code que genera planes de entrenamiento de resistencia complejos mediante prompts y sube automáticamente entrenamientos estructurados a relojes Garmin, Coros, Suunto y Wahoo. El servidor incluye una aplicación MCP para retroalimentación visual dentro del chat de Claude.

Exportando Memorias de Agentes de IA Usando la Función de Importación de Claude
Un usuario de Reddit comparte un mensaje para extraer recuerdos almacenados de agentes de IA como ChatGPT y Claude, y luego importarlos a OpenClaw. El mensaje solicita todo el contexto almacenado, incluyendo instrucciones, detalles personales, proyectos, herramientas y preferencias.

Kvaser: Un orquestador de IA local-first de código abierto con enrutamiento de subagentes e integración con Wolfram
Kvaser es un proxy MCP de intermediario que orquesta subagentes con listas blancas inteligentes de herramientas, RAG sin incrustaciones a través de Kiwix e integración con Wolfram Engine para matemática simbólica. Construido con Qwen 3.6 35B y enrutamiento de subagentes a diferentes modelos/máquinas.

Mostrar HN: WUPHF — Wiki de LLM al estilo Karpathy con Markdown + Git como fuente de verdad
WUPHF incluye una capa wiki para agentes de IA que usa Markdown + Git para persistencia, bleve (BM25) + SQLite para recuperación, con registros de hechos por entidad, wikilinks y un cron de lint diario. Se ejecuta localmente sin dependencia de bases de datos vectoriales por ahora.