Resumen de reuniones en una GPU de 6GB: qwen3.5:0.8B funciona en 57s, Granite 4 350M alucina

✍️ OpenClawRadar📅 Publicado: 19 de mayo de 2026🔗 Source
Resumen de reuniones en una GPU de 6GB: qwen3.5:0.8B funciona en 57s, Granite 4 350M alucina
Ad

VoiceFlow es una herramienta de dictado y transcripción de código abierto (MIT) que funciona completamente local; la única llamada de red es un endpoint opcional de resumen LLM (Ollama, llama.cpp, Groq, OpenAI). v1.6.0, lanzada hoy, añade un grabador de reuniones: micrófono + audio del sistema mezclados en un archivo estéreo, transcritos por faster-whisper y luego resumidos por cualquier endpoint que configures.

Evaluación comparativa: Modelos sub-1B en transcripciones de reuniones reales

En una RTX 3060 Laptop 6GB (~4.3GB libres después de cargar Whisper, Ollama 0.23, Arch Linux), con una transcripción real de 4 minutos (~2900 caracteres):

  • qwen3.5:0.8B (873M, Q8_0) — el num_ctx predeterminado (4096) fue consumido por los tokens de pensamiento. Solución:
    FROM qwen3.5:0.8b
    PARAMETER num_ctx 16384
    Tras la corrección: resumen estructurado de 1562 caracteres (TL;DR, decisiones, elementos de acción, preguntas abiertas) en 57 segundos, usando 2.2GB de VRAM. Funciona.
  • Granite 4.0 350M — más rápido (0.6–2.8s por resumen), salida correctamente estructurada, pero alucinó gravemente: en una transcripción sobre la adquisición de Bun por parte de Anthropic, devolvió “La adquisición de Anthropic por parte de Anthropic” e inventó Binance. En otra reunión, produjo un registro de puente de Star Trek (“Starship Cassiopeia”). Las palabras clave estaban presentes, pero las relaciones estaban desordenadas.

Conclusión: qwen3.5:0.8B es el mínimo funcional para el resumen local de reuniones; ningún modelo sub-500M ha producido una salida coherente con datos conversacionales reales hasta ahora.

Ad

Opción gratuita en la nube: Groq's llama-3.3-70B

El nivel gratuito de Groq con llama-3.3-70B ofrece resúmenes en ~2 segundos, con una salida “más ajustada” que la del 0.8B local. El único fallo fue una transcripción de 4 horas que excedía su ventana de contexto. Para la mayoría de las duraciones de reuniones, es una sólida alternativa gratuita.

La pregunta abierta: Resumen de contexto largo en VRAM baja

El autor pregunta a la comunidad: para transcripciones de 1 a 2 horas (~30K–60K tokens) en una GPU de 6-8GB, ¿qué funciona? Opciones: contexto más amplio (consume VRAM), map-reduce por fragmentos, o un modelo pequeño diferente que mantenga la estructura en entradas largas, sin necesidad de 24GB.

VoiceFlow se distribuye como un solo .exe (Windows) o .AppImage (Linux), construido con Pyloid + React + faster-whisper + SQLite. Detección automática de CUDA con fallback a CPU. La configuración inicial (modelo, micrófono, tecla de acceso directo) toma aproximadamente 1 minuto.

📖 Leer la fuente original: r/LocalLLaMA

Ad

👀 Ver también

Desarrollador indie despliega sitio completo de estudio de juegos vía Claude Code, incluyendo capa de datos de la API de Steam
Herramientas

Desarrollador indie despliega sitio completo de estudio de juegos vía Claude Code, incluyendo capa de datos de la API de Steam

Un desarrollador de videojuegos independiente usó Claude Code para construir y desplegar el sitio web de su estudio sin tocar una terminal, incluyendo una capa de datos que extrae información en vivo de la API de Steam.

OpenClawRadar
Construyendo un Agente de Investigación Autónomo con C# y LLMs Locales
Herramientas

Construyendo un Agente de Investigación Autónomo con C# y LLMs Locales

Un agente de investigación en C# automatiza el procesamiento de URL con LLM locales utilizando Ollama y llama3.1:8b, generando informes estructurados en markdown a partir de búsquedas web.

OpenClawRadar
¿Por qué una única herramienta run() con comandos Unix supera a la llamada de funciones para agentes de IA?
Herramientas

¿Por qué una única herramienta run() con comandos Unix supera a la llamada de funciones para agentes de IA?

Un líder de backend con dos años de experiencia en la creación de agentes argumenta que una única herramienta run(command="...") con comandos CLI al estilo Unix supera a los catálogos tradicionales de llamadas a funciones. El enfoque aprovecha la familiaridad existente de los LLM con los comandos de shell a partir de sus datos de entrenamiento.

OpenClawRadar
claude-real-video: Herramienta gratuita para que Claude vea videos con capa de percepción
Herramientas

claude-real-video: Herramienta gratuita para que Claude vea videos con capa de percepción

claude-real-video añade una capa de percepción local para que Claude vea movimientos de cámara, ritmo, gestos y emociones vocales. El demo muestra la keynote de NVIDIA GTC 2026 y narra la acción en pantalla. Versión gratuita disponible.

OpenClawRadar