ScreenMind: Memoria de IA Local que Indexa Toda tu Actividad Informática

ScreenMind es un sistema de memoria local con IA que captura continuamente tu pantalla, transcribe reuniones e indexa notas de voz, creando una línea de tiempo persistente y buscable de todo lo que haces en tu computadora. Usa hashing perceptual para activarse solo cuando el contenido cambia, luego procesa cada fotograma con Gemma 4 E2B a través de llama.cpp para análisis visual, chat y procesamiento de audio.
Características principales
- Captura de pantalla con hashing perceptual — solo almacena fotogramas cuando el contenido realmente cambia
- Línea de tiempo buscable — consulta actividad pasada: "ese mensaje de error de antes", "¿en qué estaba trabajando a las 3 p.m.?"
- Chatea con tu historial — contexto persistente de IA de toda tu sesión
- Transcripción de reuniones — detecta automáticamente Zoom, Teams y Google Meet
- Notas de voz — procesadas mediante el codificador de audio de Gemma 4
- Automatizaciones en lenguaje natural — escríbelas en Markdown en inglés sencillo
- Integración MCP — conéctate a Claude y Cursor
Stack técnico
- Modelos: Gemma 4 E2B (maneja visión, chat, audio)
- Backend: Python + FastAPI
- Almacenamiento: SQLite
- Inferencia: llama.cpp con cuantización Q4
- Hardware: 4GB+ VRAM
El autor señala que la planificación de GPU entre tareas de visión, chat y audio es el principal desafío de optimización de inferencia. El proyecto aún está impulsado por flujos de trabajo, no es completamente autónomo; la calidad de recuperación y la fricción de incorporación son áreas que necesitan mejora.
GitHub: ayushh0110/ScreenMind
📖 Leer la fuente completa: r/LocalLLaMA
👀 Ver también

Motor de Inferencia Bodega: Optimizando la Inferencia de LLM para la Memoria Unificada de Apple Silicon
Bodega es un motor de inferencia construido específicamente para la arquitectura de memoria unificada de Apple Silicon, que aborda las limitaciones de rendimiento rediseñando el procesamiento por lotes continuo y la gestión de caché KV para MLX. El desarrollador informa haber trabajado en él durante 2.5 años con optimizaciones cercanas a la capa Metal.

XLI: Biblioteca de Python de código abierto para interfaces de terminal al estilo de Claude Code
¿Construyendo un agente de codificación? La UX del terminal es la mitad del trabajo. XLI es un motor de renderizado Python de código abierto que replica el markdown en streaming, tarjetas de herramientas, aprobaciones en línea y comandos slash de Claude Code sin secuestrar el scrollback de tu terminal.

Configuración de OpenClaw sin Interfaz Gráfica con Discord mediante Scripts Docker
Un repositorio de GitHub proporciona scripts para ejecutar OpenClaw con Discord en un contenedor Docker sin interfaz gráfica, evitando la TUI/WebUI. Incluye un script de gestión con comandos como claw init, start y stop, además de soporte preconfigurado para OpenAI Responses API, Chromium y varias herramientas.

La herramienta Monitor de Claude Code envía registros del servidor de desarrollo a correcciones automáticas impulsadas por IA
La herramienta Monitor de Claude Code te permite ejecutar un servidor de desarrollo en segundo plano, monitorear registros con filtros grep inteligentes y hacer que Claude detecte errores automáticamente, escriba correcciones y las confirme — todo mientras tú pruebas la interfaz.