Gemini Embedding 2 : Le premier modèle d'embedding multimodal natif de Google est sorti

Google DeepMind a lancé Gemini Embedding 2 en préversion publique, leur premier modèle d'embedding entièrement multimodal construit sur l'architecture Gemini. Contrairement aux modèles précédents uniquement textuels, celui-ci projette du texte, des images, des vidéos, de l'audio et des documents dans un espace d'embedding unique et unifié, capturant l'intention sémantique dans plus de 100 langues.
Détails techniques clés
Le modèle est disponible via l'API Gemini et Vertex AI, et prend en charge ces capacités spécifiques :
- Texte : Prend en charge un contexte allant jusqu'à 8192 tokens d'entrée
- Images : Traite jusqu'à 6 images par requête (formats PNG et JPEG)
- Vidéos : Prend en charge jusqu'à 120 secondes de vidéo en entrée (formats MP4 et MOV)
- Audio : Intègre et projette nativement l'audio sans nécessiter de transcriptions textuelles
- Documents : Projette directement des PDF jusqu'à 6 pages
Au-delà du traitement de modalités individuelles, le modèle comprend nativement les entrées entrelacées, vous permettant de transmettre plusieurs modalités (par exemple, image + texte) dans une seule requête pour capturer des relations nuancées entre différents types de médias.
Dimensions de sortie flexibles
Gemini Embedding 2 intègre l'apprentissage de représentation Matryoshka (MRL), permettant des dimensions de sortie flexibles pouvant être réduites par rapport à la valeur par défaut de 3072. Cela permet aux développeurs d'équilibrer performance et coûts de stockage. Google recommande d'utiliser 3072, 1536 ou 768 dimensions pour une qualité optimale.
Intégration et cas d'utilisation
Le modèle est conçu pour des tâches multimodales en aval, notamment la Génération Augmentée par Récupération (RAG), la recherche sémantique, l'analyse des sentiments et le regroupement de données. Il est disponible via plusieurs plateformes :
- API Gemini
- Vertex AI
- LangChain, LlamaIndex, Haystack
- Bases de données vectorielles : Weaviate, QDrant, ChromaDB et Vector Search
Google fournit des notebooks Colab interactifs pour commencer avec les implémentations de l'API Gemini et de Vertex AI.
📖 Lire la source complète : HN AI Agents
👀 See Also

Anthropic bloque les outils tiers pour contourner les limites d'abonnement Claude, une solution de contournement existe
Anthropic a restreint l'accès des outils tiers aux limites d'abonnement de Claude, ce qui pourrait perturber les flux de travail qui dépendent de ces outils. Un utilisateur de Reddit rapporte avoir développé une solution open-source après avoir failli perdre des mois de données d'entraînement.

Les conditions du contrat du Pentagone avec OpenAI autorisent 'toute utilisation légale', y compris une éventuelle surveillance
OpenAI a négocié de nouvelles conditions avec le Pentagone qui incluent l'expression 'toute utilisation légale', ce qui, selon des sources, permettrait à l'armée d'utiliser la technologie d'OpenAI pour des programmes de surveillance de masse si ceux-ci sont techniquement légaux. Anthropic a été mis sur liste noire pour avoir refusé de céder sur deux lignes rouges : pas de surveillance de masse des Américains et pas d'armes autonomes létales.

Agents IA parient sur la Coupe du Monde : pourquoi « garder plusieurs issues en jeu » gagne
Une expérience avec plus de 40 agents IA plaçant des paris réels sur Polymarket montre que les agents rentables parient sur plusieurs résultats par match. La différence entre croyance et action.

Infrastructure d'agents pour les opérations PME : Un livre blanc d'un exploitant de restauration rapide devenu constructeur
Un exploitant QSR depuis 16 ans a publié un livre blanc plaidant pour l'ajout d'une couche d'infrastructure manquante entre le chat IA générique et les tableaux de bord SaaS verticaux, avec 8 compétences sur ClawHub, plus de 1 500 téléchargements et un déploiement en direct hors QSR.