Interfaz de chatbot de una sola página para ejecutar localmente Gemma 4 26B A4B

✍️ OpenClawRadar📅 Publicado: 21 de abril de 2026🔗 Source
Interfaz de chatbot de una sola página para ejecutar localmente Gemma 4 26B A4B
Ad

Un desarrollador ha creado una interfaz de chatbot de una sola página HTML diseñada para funcionar con Gemma 4 26B A4B ejecutándose localmente. La implementación se conecta a la API de LM Studio y proporciona una interfaz de chatbot completa en un solo archivo HTML.

Implementación Técnica

El sistema ejecuta Gemma 4 26B A4B localmente con una ventana de contexto de 32K, logrando 50-65 tokens por segundo. El modelo está distribuido entre dos GPUs: una 7900 XT y una 3060 Ti.

Características de la Interfaz

  • Soporte completo de transmisión para respuestas en tiempo real
  • Renderizado de Markdown para salida formateada
  • Selector de modelos para cambiar entre modelos disponibles
  • Seis controles deslizantes de parámetros para ajustar el comportamiento del modelo
  • Edición de mensajes con capacidades de bifurcación del historial
  • Función de regenerar para regenerar respuestas
  • Botón de abortar para detener la generación durante la transmisión
  • Soporte de instrucciones personalizadas mediante prompts del sistema
Ad

Detalles de Desarrollo

El desarrollador señala que se utilizó Claude para corregir dos errores del DOM que Gemma no pudo resolver. Todo el resto del trabajo de desarrollo se completó utilizando Gemma 4. El proyecto está disponible en GitHub para su examen y uso.

Este tipo de interfaz de una sola página es particularmente útil para desarrolladores que trabajan con LLMs locales y desean una interfaz de chat liviana y personalizable sin la complejidad de aplicaciones web complejas. La integración con la API de LM Studio la hace compatible con varios modelos locales más allá de solo Gemma.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Ver también

Qwen 3.6 27B alcanza una velocidad 2.5 veces mayor con decodificación especulativa MTP en llama.cpp
Herramientas

Qwen 3.6 27B alcanza una velocidad 2.5 veces mayor con decodificación especulativa MTP en llama.cpp

Un usuario de Reddit reporta inferencia 2.5 veces más rápida en Qwen 3.6 27B usando decodificación especulativa MTP con un PR personalizado de llama.cpp, alcanzando 28 tok/s en Mac M2 Max 96GB. Incluye cuantizaciones GGUF preconvertidas y plantillas de chat corregidas.

OpenClawRadar
Matriz LLM: Comparaciones de Modelos Votados por la Comunidad Construida con Claude Code
Herramientas

Matriz LLM: Comparaciones de Modelos Votados por la Comunidad Construida con Claude Code

Un científico de datos creó llm-matrix.vercel.app para comparar puntuaciones de LLM en múltiples dimensiones simultáneamente, con votos de la comunidad que moldean las clasificaciones. El sitio fue desarrollado completamente usando Claude Code con dos complementos específicos.

OpenClawRadar
Claude Code Hook Monitorea la Acumulación de WIP en los Flujos de Trabajo de Codificación con IA
Herramientas

Claude Code Hook Monitorea la Acumulación de WIP en los Flujos de Trabajo de Codificación con IA

Un desarrollador creó un gancho UserPromptSubmit para Claude Code que muestra la acumulación de trabajo en progreso en cuatro colas: cambios sin confirmar de más de 200 líneas, tres o más confirmaciones sin enviar, confirmaciones enviadas sin archivos de conjunto de cambios y PRs de lanzamiento abiertos por más de 24 horas.

OpenClawRadar
Sentinel: Plataforma de Agentes Autohospedados para Suscriptores de Claude Code
Herramientas

Sentinel: Plataforma de Agentes Autohospedados para Suscriptores de Claude Code

Sentinel es una plataforma de agentes gratuita y de código abierto que se ejecuta directamente en su token OAuth de Claude Code existente sin sobrecarga de API. Proporciona una interfaz de operador limpia con automatización de navegador en tiempo real a través de VNC integrado e incluye funciones como control de Git, registros de seguimiento de sesiones y memoria jerárquica estructurada.

OpenClawRadar