Gemma-4 26B-A4B avec Opencode fonctionne efficacement sur MacBook Air M5

✍️ OpenClawRadar📅 Publié: April 14, 2026🔗 Source
Gemma-4 26B-A4B avec Opencode fonctionne efficacement sur MacBook Air M5
Ad

Un développeur a testé Gemma-4-26B-A4B avec Opencode sur un MacBook Air M5 32 Go et a constaté qu'il offre des performances pratiques pour les tâches locales de codage IA.

Benchmarks de performance

La configuration spécifique testée était gemma-4-26B-A4B-it-UD-IQ4_XS fonctionnant sur un MacBook Air M5 32 Go. En mode basse consommation, il a atteint :

  • 300 tokens/seconde pour le traitement des invites
  • 12 tokens/seconde en génération
  • 8 W de consommation d'énergie
  • Aucune chaleur ni bruit de ventilateur pendant le fonctionnement

Le MacBook Air M5 a montré des améliorations significatives par rapport au matériel précédent :

  • ~25 % plus rapide pour le traitement des invites qu'un M1 Max 64 Go (même lorsque le Max n'était pas en mode économie d'énergie)
  • ~6 heures d'autonomie contre ~2 heures sur le M1 Max lors de l'exécution d'Opencode
  • Ceci malgré une batterie plus petite (53,8 Wh contre 70 Wh sur le M1 Max)
Ad

Cas d'utilisation pratiques

Le développeur a trouvé cette configuration "réellement utilisable" pour un comportement de codage agentique depuis un ordinateur portable. Auparavant, l'exécution de LLM sur un M1 Max 64 Go était limitée à des "bidouillages et cas d'utilisation ludiques" et ne pouvait pas gérer efficacement les tâches à contexte long. Bien qu'il puisse créer un simple jeu Snake en Python, le codage agentique ou la contribution à des bases de code plus importantes était "un peu bancal".

Les performances du M5 le rendent pratique pour les cas d'utilisation mobiles où la connectivité Internet pourrait être peu fiable, comme dans les cafés ou lors des trajets en train.

Comparaison avec d'autres modèles

Le développeur a comparé Gemma-4-26B avec Opencode aux alternatives propriétaires :

  • Il ne remplace pas Claude Code ou Antigravity selon leurs tests
  • Gemma-4 nécessite "beaucoup plus d'accompagnement que les modèles propriétaires de pointe actuels"
  • Les réponses sont décrites comme "un peu sèches" par rapport à Claude Code ou Gemini-3.1-Pro avec Antigravity
  • Cependant, ils préféreraient Gemma-4-26B plutôt que de manquer de quota Gemini-2.5-Pro et être obligés d'utiliser Gemini-2.5-Flash

Le développeur note que cela représente des progrès significatifs, car "ce type de codage agentique était à la pointe / pas vraiment possible avec les modèles de pointe fin 2024".

📖 Read the full source: r/LocalLLaMA

Ad

👀 See Also

La méthode de quantification JANG améliore les performances de MLX pour les grands modèles
Tools

La méthode de quantification JANG améliore les performances de MLX pour les grands modèles

Une nouvelle méthode de quantification appelée JANG permet d'exécuter de grands modèles comme MiniMax-M2.5 et Qwen 3.5 sur le framework MLX d'Apple avec des performances nettement supérieures à la quantification MLX standard, atteignant des vitesses quasi natives tout en conservant une précision comparable aux quantifications à plus de bits.

OpenClawRadar
Complexité Temporelle MCP : L'Outil d'Analyse Statique Transmet la Complexité en Notation Grand O aux Agents d'IA de Codage
Tools

Complexité Temporelle MCP : L'Outil d'Analyse Statique Transmet la Complexité en Notation Grand O aux Agents d'IA de Codage

Time Complexity MCP est un serveur MCP open source qui effectue une analyse statique de code pour détecter la complexité Big-O, transmettant directement les résultats à des agents d'IA de codage comme Claude Code ou Copilot sans consommation de tokens. Il prend en charge JavaScript, TypeScript, Python, Java, Kotlin et Dart.

OpenClawRadar
Moteur d'Inférence Bodega : Optimisation de l'inférence LLM pour la mémoire unifiée d'Apple Silicon
Tools

Moteur d'Inférence Bodega : Optimisation de l'inférence LLM pour la mémoire unifiée d'Apple Silicon

Bodega est un moteur d'inférence conçu spécifiquement pour l'architecture de mémoire unifiée d'Apple Silicon, développé sur 2,5 ans avec des optimisations proches de la couche Metal sur MLX. Il résout les limitations fondamentales de débit auxquelles les développeurs sont confrontés lors de l'exécution de LLM sur le matériel Mac.

OpenClawRadar
Outil Local d'Analyse d'Images par IA Utilise des Modèles de Vision Ollama pour les Retours
Tools

Outil Local d'Analyse d'Images par IA Utilise des Modèles de Vision Ollama pour les Retours

Un développeur a créé une application de bureau gratuite qui analyse localement les images générées par IA à l'aide des modèles de vision Ollama. L'outil fournit des rapports de retour structurés incluant des suggestions d'amélioration et des optimisations de prompts.

OpenClawRadar