Puntos de Referencia de Rendimiento de LLM Local en Mac Mini con OpenClaw y LM Studio

Un usuario de Reddit compartió puntos de referencia concretos de rendimiento para ejecutar un modelo de lenguaje grande localmente en un Mac Mini con 32 GB de RAM. La publicación aborda la escasez de datos de rendimiento específicos para esta configuración de hardware.
Detalles de la configuración técnica
El usuario reportó la siguiente configuración y resultados:
- Versiones de software: OpenClaw 2026.3.8, LM Studio 0.4.6+1
- Modelo: Unsloth gpt-oss-20b-Q4_K_S.gguf
- Tamaño de contexto: 26035
- Métricas de rendimiento: 34 tokens/segundo después del primer prompt, 0.7 segundos de tiempo para el primer token
Configuración del modelo
El usuario especificó estas configuraciones del modelo (todas en valores predeterminados):
- GPU offload = 18
- Tamaño del grupo de hilos de CPU = 7
- Máximo de concurrentes = 4
- Número de expertos = 4
- Atención flash = activada
La cuantización Q4_K_S indica que esta es una versión cuantizada de 4 bits del modelo de 20 mil millones de parámetros, lo que reduce los requisitos de memoria mientras mantiene un rendimiento razonable. Los 32 GB de RAM en el Mac Mini son suficientes para este tamaño de modelo con la longitud de contexto dada. El rendimiento de 34 tokens/segundo es un punto de referencia práctico para desarrolladores que consideran configuraciones locales similares de LLM en hardware Apple Silicon.
📖 Read the full source: r/openclaw
👀 Ver también

La herramienta de corrección de memoria OpenClaw aborda la degradación del rendimiento.
Un nuevo comando de barra llamado /claw_memory_fix ayuda a limpiar los archivos de memoria de OpenClaw cuando el agente olvida credenciales o permisos. La herramienta implementa técnicas de Alibaba, ingeniería de GitHub, MemGPT e investigaciones de enero de 2026 sobre gestión de memoria.

Agent Browser Shield: Extensión gratuita de OpenClaw que bloquea inyección de indicaciones y patrones oscuros
PixieBrix lanza Agent Browser Shield, una extensión gratuita de código disponible para OpenClaw que bloquea inyección de prompts, patrones oscuros y contaminación de contexto, reduciendo el uso de tokens.

Claw Code Agent: Reimplementación en Python de la Arquitectura Claude Code para Modelos Locales
Claw Code Agent es una reimplementación en Python de la arquitectura del agente Claude Code que funciona con modelos de código abierto locales a través de backends compatibles con OpenAI como vLLM y Ollama, incluyendo llamadas a herramientas, comandos de barra y permisos escalonados.

LocalSynapse MCP Server Agrega Compatibilidad con macOS y Mejoras en la Búsqueda
LocalSynapse, un servidor MCP sin conexión para buscar en documentos locales, ahora es compatible con macOS e incluye correcciones para consultas de búsqueda de varias palabras. El desarrollador ha implementado mejoras basadas en comentarios, incluyendo el impulso de clics ajustado por posición y la descomposición temporal como promoción.