GLM 5 sur Mac M3 : Observations de performance pour le codage agentique

Benchmarks de performance et limitations
Un développeur a testé GLM 5 en utilisant la quantification 4 bits de MLX sur un Mac M3 avec 512 Go de RAM pour des tâches de codage agentique. Le modèle est décrit comme "assez utilisable" lorsque le contexte est maintenu en dessous d'environ 50 000 tokens, bien que significativement plus lent que les solutions basées sur des API comme Claude, notamment pendant le traitement des invites.
La performance se dégrade considérablement lorsque le contexte dépasse 50 000 tokens. Dans un test traitant 65 000 tokens, la première moitié s'est terminée en 8 minutes (67 tokens/seconde), tandis que la seconde moitié a pris 18 minutes supplémentaires, résultant en un taux global de 41 tokens/seconde. La génération de tokens reste plus rapide, estimée à 12-20 tokens/seconde pour des contextes plus importants.
Observations sur le flux de travail
L'utilisateur note qu'Opencode (le système de codage agentique) gère efficacement la génération de code multi-fichiers une fois qu'un plan est créé, produisant "des milliers de tokens de code à travers plusieurs fichiers en seulement quelques minutes avec un raisonnement entre les deux". Le traitement des invites prend généralement "quelques minutes" pour lire quelques centaines de lignes de code par fichier, avec environ 10 minutes au total réparties sur les sessions de planification.
La compaction dans Opencode "prend un certain temps car elle aime essentiellement retraiter tout le contexte". Avec une limite de contexte de 50 000 tokens, la compaction prend environ 5 minutes.
Configuration technique et attentes futures
Le test a été réalisé en utilisant LM Studio, qui peut ne pas fournir les dernières optimisations d'exécution. L'utilisateur suggère que "MLX ou même GGUF pourraient obtenir un traitement d'invite plus rapide à mesure que les environnements d'exécution sont mis à jour pour GLM 5, mais il ne deviendra probablement pas BEAUCOUP plus rapide que cela".
Cette configuration n'est pas recommandée pour les tâches nécessitant 70 000+ tokens de contexte en raison à la fois des limitations de taille de contexte et de la "lenteur insupportable" qui survient après avoir dépassé certains seuils pendant le traitement des invites.
📖 Lire la source complète : r/LocalLLaMA
👀 See Also

Mia : Démon d'espace de travail IA local avec application Android native et diffusion P2P
Mia est un démon qui s'exécute sur votre machine et s'associe à une application Android native via P2P, vous permettant de lancer et de surveiller des tâches de codage IA de longue durée depuis votre téléphone. Il prend en charge les agents OpenCode, Claude Code, Gemini CLI et Codex, diffusant la sortie directement sur votre appareil en temps réel.

Hébergement natif d’agents compatible MCP : Déployez des applications via des agents IA sur ocl-nexus
ocl-nexus présente une configuration de serveur MCP qui permet aux agents de codage IA de déployer des applications directement dans un environnement live protégé par SSO en utilisant simplement une clé API.

X-MCP 2.0 : Serveur MCP pour l'accès à l'API X/Twitter depuis Claude
X-MCP 2.0 est un serveur MCP qui connecte Claude Desktop et Claude Code à l'API X/Twitter v2 avec l'authentification OAuth 2.0 PKCE, offrant 10 outils pour publier des tweets, effectuer des recherches, obtenir des timelines, aimer, retweeter, répondre et consulter des profils.

PocketBot Beta : Agent IA iOS axé sur la confidentialité avec moteur hybride local/cloud
PocketBot est un agent d'IA iOS qui fonctionne en arrière-plan, s'intègre aux App Intents, et utilise un moteur hybride : exécution locale pour les déclencheurs système et l'anonymisation des données personnelles, avec traitement cloud pour les tâches complexes comme la synthèse d'e-mails ou la réservation de vols.