Gemini Embedding 2: El Primer Modelo de Incrustación Nativamente Multimodal de Google Lanzado

✍️ OpenClawRadar📅 Publicado: 11 de marzo de 2026🔗 Source
Gemini Embedding 2: El Primer Modelo de Incrustación Nativamente Multimodal de Google Lanzado
Ad

Google DeepMind ha lanzado Gemini Embedding 2 en vista previa pública, su primer modelo de incrustación completamente multimodal construido sobre la arquitectura Gemini. A diferencia de los modelos anteriores solo de texto, este mapea texto, imágenes, videos, audio y documentos en un único espacio de incrustación unificado, capturando la intención semántica en más de 100 idiomas.

Detalles Técnicos Clave

El modelo está disponible a través de la API Gemini y Vertex AI, y admite estas capacidades específicas:

  • Texto: Admite contexto de hasta 8192 tokens de entrada
  • Imágenes: Procesa hasta 6 imágenes por solicitud (formatos PNG y JPEG)
  • Videos: Admite hasta 120 segundos de video de entrada (formatos MP4 y MOV)
  • Audio: Ingresa e incrusta audio de forma nativa sin necesidad de transcripciones de texto
  • Documentos: Incrusta directamente PDF de hasta 6 páginas de longitud

Más allá de procesar modalidades individuales, el modelo comprende de forma nativa la entrada intercalada, permitiéndote pasar múltiples modalidades (por ejemplo, imagen + texto) en una sola solicitud para capturar relaciones matizadas entre diferentes tipos de medios.

Ad

Dimensiones de Salida Flexibles

Gemini Embedding 2 incorpora Aprendizaje de Representación Matryoshka (MRL), permitiendo dimensiones de salida flexibles que se reducen desde el valor predeterminado de 3072. Esto permite a los desarrolladores equilibrar el rendimiento y los costos de almacenamiento. Google recomienda usar dimensiones de 3072, 1536 o 768 para la más alta calidad.

Integración y Casos de Uso

El modelo está diseñado para tareas multimodales posteriores, incluyendo Generación Aumentada por Recuperación (RAG), búsqueda semántica, análisis de sentimientos y agrupación de datos. Está disponible a través de múltiples plataformas:

  • API Gemini
  • Vertex AI
  • LangChain, LlamaIndex, Haystack
  • Bases de datos vectoriales: Weaviate, QDrant, ChromaDB y Vector Search

Google proporciona cuadernos interactivos de Colab para comenzar con las implementaciones de la API Gemini y Vertex AI.

📖 Read the full source: HN AI Agents

Ad

👀 Ver también

OpenAI y sus rivales publican plugins de agentes: un formato de paquete para agentes de IA
Noticias

OpenAI y sus rivales publican plugins de agentes: un formato de paquete para agentes de IA

OpenAI, Amazon, Microsoft, Cursor y Vercel lanzaron Agent Plugins 1.0, un estándar abierto para empaquetar extensiones de agentes de IA. Crea una vez, ejecuta en ChatGPT, Codex, Copilot, Cursor y más.

OpenClawRadar
Desarrolladores de Spotify aprovechando la IA para contribuciones sin código.
Noticias

Desarrolladores de Spotify aprovechando la IA para contribuciones sin código.

Los principales desarrolladores de Spotify no han escrito código desde diciembre debido a la IA, notablemente a través de su sistema interno 'Honk' que facilita implementaciones de código remotas y en tiempo real utilizando Claude Code.

OpenClawRadar
Claude Code v2.1.163: Fijación de Versión, Lista de Plugins, Mejoras en Hooks y Correcciones Críticas de Errores
Noticias

Claude Code v2.1.163: Fijación de Versión, Lista de Plugins, Mejoras en Hooks y Correcciones Críticas de Errores

Claude Code v2.1.163 añade requiredMinimumVersion/requiredMaximumVersion en ajustes gestionados, el comando /plugin list, mejoras en el contexto de hooks y correcciones para cuelgues de claude -p, EEXIST en Windows y la regresión de Bazel/EDR.

OpenClawRadar
Sistema del Agente OpenClaw Roto Después de Actualizaciones Recientes
Noticias

Sistema del Agente OpenClaw Roto Después de Actualizaciones Recientes

Las actualizaciones recientes de OpenClaw han roto la funcionalidad central de los agentes, con usuarios reportando que los agentes no se pueden crear o ejecutar de manera confiable. El sistema anteriormente permitía crear agentes, que aparecían correctamente, ejecutar flujos de trabajo y usarlos para tareas reales.

OpenClawRadar