Gemma 4 Sorti : Quatre Tailles de Modèles pour l'Hébergement d'IA en Local

Spécifications des modèles Gemma 4
Gemma 4 est désormais disponible en tant que modèle d'IA auto-hébergé avec quatre configurations distinctes pour différents scénarios matériels. Selon la source, il ne rivalise pas avec Claude, Codex ou Gemini, mais se positionne comme une option pratique pour les scénarios multi-routage où un petit modèle auto-hébergé performant peut économiser des tokens.
Variantes de modèles et exigences matérielles
- E2B (2,3 milliards de paramètres effectifs) : Conçu pour les appareils périphériques comme les téléphones et les Raspberry Pi. Nécessite ~4-8 Go de RAM et fonctionne bien sur un CPU. Recommandé pour l'hébergement sur VPS.
- E4B (4,5 milliards de paramètres effectifs) : Conçu pour les ordinateurs portables et le matériel bas de gamme. Conserve une empreinte mémoire faible.
- 26B MoE (25 milliards au total, 3,8 milliards actifs) : Conçu pour les GPU grand public. Fonctionne à des vitesses d'inférence similaires à un modèle de 4 milliards.
- 31B Dense : Conçu pour les GPU et stations de travail milieu de gamme. Nécessite environ 16-20 Go de VRAM lors de l'utilisation d'une quantification 4 bits.
Capacités et disponibilité
Tous les modèles Gemma 4 sont multimodaux avec des capacités texte et vision. Les modèles périphériques E2B et E4B prennent spécifiquement en charge l'audio en temps réel. Les modèles sont conçus pour un raisonnement avancé et des flux de travail agentiques.
Gemma 4 est disponible sur Google AI Studio, Hugging Face, Kaggle et Ollama.
📖 Read the full source: r/openclaw
👀 See Also

Anthropic publie un outil d'IA pour analyser les bases de code COBOL, l'action IBM chute de 13 %.
Anthropic a publié un outil d'IA qui analyse les bases de code COBOL pour identifier les risques et réduire les coûts de modernisation. L'annonce a provoqué une chute de 13 % de l'action d'IBM, le marché y voyant une menace pour les activités d'IBM dans la gestion des systèmes hérités.
L'IA Pointer de Google DeepMind : Réinventer la souris pour les interactions avec Gemini
Google DeepMind présente un pointeur alimenté par l'IA qui utilise Gemini pour comprendre le contexte, permettant des commandes comme pointer une image et dire 'Montre-moi les directions', intégré dans Chrome et Googlebook.

Discussion Reddit sur l'impact de Claude sur le développement du MVP et les pièges pour les fondateurs
Un utilisateur de Reddit explique comment Claude IA réduit les barrières techniques pour créer des MVP de 3 000 à 5 000 $ en mode DIY, mais met en garde contre une concurrence accrue et le fait que les fondateurs se concentrent trop sur le développement au détriment du marketing, du PMF et des opérations.

Analyse des coûts de DeepSeek V4 Flash : Taux de cache et rapport de prix expliqués
DeepSeek V4 Flash coûte 0,0066x par tâche agentique par rapport à Opus 4.7, grâce à un taux de hit de cache de 97 % et un rapport de prix lecture-écriture du cache de 0,02.