Évaluation comparative de 88 petits modèles GGUF sur un Mac Mini M4 16 Go

Un pipeline automatisé a été développé pour télécharger, évaluer, téléverser et supprimer des modèles GGUF par vagues sur un Mac Mini M4 avec une mémoire unifiée de 16 Go. Le pipeline a testé 88 modèles pour trouver des LLM locaux adaptés à cette configuration matérielle.
Principales Constatations
- 9 modèles sur 88 sont inutilisables avec 16 Go de RAM - Tout modèle dont les poids plus le cache KV dépassent environ 14 Go provoque un thrashing mémoire, entraînant un TTFT > 10 secondes ou < 0,1 token/seconde. Cela inclut tous les modèles denses 27B+.
- Seulement 4 modèles se situent sur la frontière de Pareto du débit par rapport à la qualité - Tous sont de l'architecture LFM2-8B-A1B (MoE de LiquidAI avec 1 milliard de paramètres actifs). La conception MoE signifie qu'environ 1 milliard de paramètres sont actifs par token, atteignant 12-20 tokens/seconde là où les modèles denses 8B plafonnent à 5-7 tokens/seconde.
- L'échelle de contexte de 1k à 4k est plate - La plupart des modèles ne montrent aucune dégradation du débit, certaines variantes LFM2 accélérant même à un contexte de 4k.
- La mise à l'échelle de la concurrence est médiocre (0,57x à une concurrence de 2 vs un idéal de 2,0x) - Le Mac Mini est limité par la bande passante mémoire, il est donc recommandé d'exécuter une requête à la fois.
Modèles sur la Frontière de Pareto
Ces quatre modèles surpassent tous les autres à la fois en vitesse et en qualité :
- LFM2-8B-A1B-Q5_K_M (unsloth) : 14,24 TPS en moyenne, score de qualité 44,6
- LFM2-8B-A1B-Q8_0 (unsloth) : 12,37 TPS en moyenne, score de qualité 46,2
- LFM2-8B-A1B-UD-Q8_K_XL (unsloth) : 12,18 TPS en moyenne, score de qualité 47,9
- LFM2-8B-A1B-Q8_0 (LiquidAI) : 12,18 TPS en moyenne, score de qualité 51,2
L'évaluation de la qualité a utilisé des sous-ensembles compacts (20 questions GSM8K + 60 questions MMLU) - utiles pour le classement mais pas pour des chiffres absolus de qualité publication.
Recommandations
Pour la meilleure qualité : LFM2-8B-A1B-Q8_0. Pour la vitesse : Q5_K_M. Pour l'équilibre : UD-Q6_K_XL.
Détails Techniques
- Matériel : Mac Mini M4, mémoire unifiée de 16 Go, macOS 15.x
- Logiciel : llama-server (llama.cpp)
- Méthodologie : Les chiffres de débit sont le p50 sur plusieurs requêtes
- Données : Toutes les données sont reproductibles à partir des artefacts du dépôt
Le pipeline complet est automatisé et open source. Les données CSV avec les 88 modèles et les scripts de benchmark sont disponibles dans le dépôt.
📖 Lire la source complète : r/LocalLLaMA
👀 See Also

Claude ajoute une fonctionnalité d'importation de mémoire pour migrer depuis d'autres fournisseurs d'IA.
Claude permet désormais aux utilisateurs d'importer le contexte et les préférences d'autres fournisseurs d'IA via un processus de copier-coller. La fonctionnalité de mémoire est disponible sur tous les plans payants et aide à maintenir l'historique des conversations lors du changement de plateforme.

Présentation de NetViews 2.3 : Un outil de diagnostic réseau robuste pour macOS
NetViews 2.3 combine la découverte d'hôtes, les informations Wi-Fi et la surveillance en temps réel avec une interface graphique rationalisée pour de meilleurs diagnostics réseau sur macOS.

Codegraph : Un graphe de connaissances pré-indexé réduit de 94 % les appels d'outils Claude/Cursor
Codegraph utilise un graphe de connaissances pré-indexé des relations entre symboles, des graphes d'appel et de la structure du code pour réduire les appels d'outils API jusqu'à 94 % et accélérer l'utilisation d'environ 77 % pour les agents Claude, Cursor, Codex et OpenCode.

MCP en tant qu'Interface d'Observabilité : Connecter les Agents IA aux Points de Trace du Noyau
Le Model Context Protocol (MCP) émerge comme l'interface entre les agents d'IA et la télémétrie d'infrastructure, avec Datadog qui livre un serveur MCP et Qualys qui signale des préoccupations de sécurité. L'article explore deux approches : encapsuler des plateformes existantes ou construire une observabilité native MCP qui se connecte directement aux points de trace du noyau.