Gemini Embedding 2 : Le premier modèle d'embedding multimodal natif de Google est sorti

Google DeepMind a lancé Gemini Embedding 2 en préversion publique, leur premier modèle d'embedding entièrement multimodal construit sur l'architecture Gemini. Contrairement aux modèles précédents uniquement textuels, celui-ci projette du texte, des images, des vidéos, de l'audio et des documents dans un espace d'embedding unique et unifié, capturant l'intention sémantique dans plus de 100 langues.
Détails techniques clés
Le modèle est disponible via l'API Gemini et Vertex AI, et prend en charge ces capacités spécifiques :
- Texte : Prend en charge un contexte allant jusqu'à 8192 tokens d'entrée
- Images : Traite jusqu'à 6 images par requête (formats PNG et JPEG)
- Vidéos : Prend en charge jusqu'à 120 secondes de vidéo en entrée (formats MP4 et MOV)
- Audio : Intègre et projette nativement l'audio sans nécessiter de transcriptions textuelles
- Documents : Projette directement des PDF jusqu'à 6 pages
Au-delà du traitement de modalités individuelles, le modèle comprend nativement les entrées entrelacées, vous permettant de transmettre plusieurs modalités (par exemple, image + texte) dans une seule requête pour capturer des relations nuancées entre différents types de médias.
Dimensions de sortie flexibles
Gemini Embedding 2 intègre l'apprentissage de représentation Matryoshka (MRL), permettant des dimensions de sortie flexibles pouvant être réduites par rapport à la valeur par défaut de 3072. Cela permet aux développeurs d'équilibrer performance et coûts de stockage. Google recommande d'utiliser 3072, 1536 ou 768 dimensions pour une qualité optimale.
Intégration et cas d'utilisation
Le modèle est conçu pour des tâches multimodales en aval, notamment la Génération Augmentée par Récupération (RAG), la recherche sémantique, l'analyse des sentiments et le regroupement de données. Il est disponible via plusieurs plateformes :
- API Gemini
- Vertex AI
- LangChain, LlamaIndex, Haystack
- Bases de données vectorielles : Weaviate, QDrant, ChromaDB et Vector Search
Google fournit des notebooks Colab interactifs pour commencer avec les implémentations de l'API Gemini et de Vertex AI.
📖 Lire la source complète : HN AI Agents
👀 See Also

En IA, le 41 % dépend du -59 %
L'économiste en chef d'Apollo analyse les marges bénéficiaires de l'IA par maillon de la chaîne de valeur : les modèles et applications affichent -59% tandis que les semi-conducteurs et équipements en amont atteignent +41%. Ce boom est financé par les investisseurs, pas par les clients.

OpenAI travaille sur un smartphone IA avec des puces MediaTek/Qualcomm ; objectif de production de masse 2028
Selon l'analyste de la chaîne d'approvisionnement Ming-Chi Kuo, OpenAI développe un smartphone IA avec les partenaires puces MediaTek et Qualcomm, le fabricant exclusif Luxshare Precision, et une production de masse prévue pour 2028. L'appareil se positionne comme une plateforme d'agents IA contextuels.

L'ordonnance du tribunal de Géorgie contient des citations juridiques hallucinées par l'IA.
Un appel devant la Cour suprême de Géorgie a révélé qu'une ordonnance d'un tribunal de première instance contenait au moins cinq références à des affaires inexistantes et cinq autres à des affaires qui ne soutiennent pas les propositions citées, l'ordonnance proposée par le procureur contenant les mêmes erreurs.

Richard Dawkins conclut que l'IA est consciente — les experts contestent
Le biologiste évolutionniste Richard Dawkins, après de longues discussions avec Claude d'Anthropic et ChatGPT d'OpenAI, a conclu que les IA sont conscientes. La plupart des scientifiques cognitivistes sont en profond désaccord, parlant d'anthropomorphisme.