Gemma4 26B-A4B Offre des Performances Locales Rapides avec Recherche Web et Prise en Charge des Images

Performances et fonctionnalités de Gemma4 26B-A4B
Le modèle gemma-4-26B-A4B démontre de solides performances pour une utilisation locale, la source rapportant des vitesses d'environ 145 tokens par seconde lors de l'exécution sur une carte graphique RTX 4090. Cette combinaison de capacités et de vitesse le rend adapté aux applications locales réactives.
Caractéristiques principales de la source
- Modèle : gemma-4-26B-A4B
- Performance : ~145 t/s (tokens par seconde) sur RTX 4090
- Intégration : Prise en charge de la recherche web MCP (Model Context Protocol)
- Multimodal : Prise en charge d'images incluse
- Plateformes : Configuration documentée pour une utilisation sur Mac et iPhone
La source mentionne que l'expérience peut être améliorée avec des astuces simples et un court prompt système, bien que les détails spécifiques de ces optimisations ne soient pas fournis dans l'extrait. L'auteur a documenté son processus de configuration complet dans un article de blog qui couvre la configuration et l'utilisation sur plusieurs appareils.
Pour les développeurs intéressés par la mise en œuvre de cette configuration, les détails complets de configuration, les prompts système et les techniques d'optimisation sont disponibles dans l'article de blog référencé à l'URL fournie.
📖 Read the full source: r/LocalLLaMA
👀 See Also

SuperHQ : Exécutez des agents de codage IA dans des sandboxes microVM isolés.
SuperHQ est une application open source en Rust/GPUI qui exécute des agents IA de codage (Claude Code, OpenAI Codex, Pi) dans des sandboxes microVM isolées. Chaque agent reçoit une VM Debian complète, monte les répertoires du projet en lecture seule et ne voit jamais les clés API de l'hôte — elles sont injectées via un proxy de passerelle d'authentification.

Adeu v1.4 : MCP open-source pour le suivi des modifications dans les fichiers DOCX
Adeu v1.4 injecte chirurgicalement des révisions OOXML natives dans les fichiers DOCX, en préservant le formatage, la numérotation et les mises en page. Ajoute l'édition en ligne des notes de bas de page et de fin, la vérification des termes définis, les cartes de renvois et l'aller-retour des listes à plusieurs niveaux.

Chambre : Agent IA pour la gestion de l'infrastructure GPU
Chamber est un agent d'IA qui gère l'infrastructure GPU en prenant en charge des tâches telles que l'approvisionnement de clusters, le diagnostic des travaux échoués et la gestion des charges de travail. Il fournit des opérations structurées avec validation et retour arrière, et non pas seulement des commandes shell brutes.

Compteur de Jetons Claude Mis à Jour avec Fonction de Comparaison de Modèles
L'outil Claude Token Counter de Simon Willison prend désormais en charge la comparaison des nombres de tokens entre différents modèles Claude. La mise à jour révèle qu'Opus 4.7 utilise 1,0 à 1,35 fois plus de tokens qu'Opus 4.6 en raison d'un tokeniseur mis à jour, ce qui pourrait augmenter les coûts d'environ 40 % malgré un tarif identique.