Evaluación comparativa de 88 modelos pequeños GGUF en un Mac Mini M4 de 16 GB

✍️ OpenClawRadar📅 Publicado: 2 de marzo de 2026🔗 Source
Evaluación comparativa de 88 modelos pequeños GGUF en un Mac Mini M4 de 16 GB
Ad

Se desarrolló una canalización automatizada para descargar, evaluar, subir y eliminar modelos GGUF en oleadas en una Mac Mini M4 con 16 GB de memoria unificada. La canalización probó 88 modelos para encontrar LLMs locales adecuados para esta configuración de hardware.

Hallazgos Clave

  • 9 de 88 modelos son inutilizables con 16 GB de RAM - Cualquier modelo donde los pesos más la caché KV superen aproximadamente 14 GB causa trashing de memoria, resultando en TTFT > 10 segundos o < 0.1 tokens/segundo. Esto incluye todos los modelos densos de 27B+.
  • Solo 4 modelos se sitúan en la frontera de Pareto de rendimiento vs calidad - Todos son arquitectura LFM2-8B-A1B (MoE de LiquidAI con 1B parámetros activos). El diseño MoE significa que solo unos 1B parámetros están activos por token, logrando 12-20 tokens/segundo donde los modelos densos de 8B alcanzan un máximo de 5-7 tokens/segundo.
  • La escalabilidad de contexto de 1k a 4k es plana - La mayoría de los modelos muestran cero degradación de rendimiento, con algunas variantes de LFM2 acelerándose incluso a 4k de contexto.
  • La escalabilidad de concurrencia es pobre (0.57x en concurrencia 2 vs ideal 2.0x) - La Mac Mini está limitada por el ancho de banda de memoria, por lo que se recomienda ejecutar una solicitud a la vez.
Ad

Modelos en la Frontera de Pareto

Estos cuatro modelos superan a todos los demás tanto en velocidad como en calidad:

  • LFM2-8B-A1B-Q5_K_M (unsloth): 14.24 TPS promedio, puntuación de calidad 44.6
  • LFM2-8B-A1B-Q8_0 (unsloth): 12.37 TPS promedio, puntuación de calidad 46.2
  • LFM2-8B-A1B-UD-Q8_K_XL (unsloth): 12.18 TPS promedio, puntuación de calidad 47.9
  • LFM2-8B-A1B-Q8_0 (LiquidAI): 12.18 TPS promedio, puntuación de calidad 51.2

La evaluación de calidad utilizó subconjuntos compactos (20 preguntas GSM8K + 60 MMLU) - útil direccionalmente para clasificar pero no números absolutos de calidad de publicación.

Recomendaciones

Para la mejor calidad: LFM2-8B-A1B-Q8_0. Para velocidad: Q5_K_M. Para equilibrio: UD-Q6_K_XL.

Detalles Técnicos

  • Hardware: Mac Mini M4, 16 GB de memoria unificada, macOS 15.x
  • Software: llama-server (llama.cpp)
  • Metodología: Los números de rendimiento son p50 sobre múltiples solicitudes
  • Datos: Todos los datos son reproducibles a partir de artefactos en el repositorio

La canalización completa está automatizada y es de código abierto. Los datos CSV con los 88 modelos y los scripts de evaluación están disponibles en el repositorio.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Ver también

CLI del Navegador: Una Herramienta de Automatización de Navegadores Eficiente en Tokens para Agentes de IA de Programación
Herramientas

CLI del Navegador: Una Herramienta de Automatización de Navegadores Eficiente en Tokens para Agentes de IA de Programación

Browser CLI es un demonio persistente de Chromium sin interfaz que proporciona automatización del navegador mediante comandos simples de Bash, logrando un ahorro de ~95% de tokens en comparación con Playwright MCP al reducir las llamadas de ~1,500 tokens a ~75 tokens.

OpenClawRadar
Zoku: Una Herramienta que Detecta Automáticamente Flujos de Trabajo Repetidos en Código Claude
Herramientas

Zoku: Una Herramienta que Detecta Automáticamente Flujos de Trabajo Repetidos en Código Claude

Zoku es una herramienta local que se conecta al sistema de eventos de Claude Code para registrar acciones de herramientas a través de sesiones, identifica patrones repetidos de flujo de trabajo y luego informa a Claude sobre estos patrones para que pueda sugerirlos o ejecutarlos proactivamente. No requiere configuración, no tiene dependencias y almacena todo localmente en ~/.zoku/.

OpenClawRadar
memv: Sistema de Memoria de Código Abierto para Agentes de IA
Herramientas

memv: Sistema de Memoria de Código Abierto para Agentes de IA

memv es un sistema de memoria de código abierto diseñado para agentes de IA que solo almacena información inesperada de las interacciones, reduciendo el ruido y la redundancia.

OpenClawRadar
Cull: Motor de código abierto para la curación de conjuntos de datos en pipelines de imágenes de IA
Herramientas

Cull: Motor de código abierto para la curación de conjuntos de datos en pipelines de imágenes de IA

Cull extrae imágenes de más de 340 fuentes, incluyendo Civitai, X/Twitter, Reddit, Discord y sitios booru, las clasifica con un modelo de lenguaje visual a través de LM Studio local o Groq, y las organiza en carpetas por categoría con prompts de SD y registros de auditoría.

OpenClawRadar