Gemini Embedding 2: El Primer Modelo de Incrustación Nativamente Multimodal de Google Lanzado

Google DeepMind ha lanzado Gemini Embedding 2 en vista previa pública, su primer modelo de incrustación completamente multimodal construido sobre la arquitectura Gemini. A diferencia de los modelos anteriores solo de texto, este mapea texto, imágenes, videos, audio y documentos en un único espacio de incrustación unificado, capturando la intención semántica en más de 100 idiomas.
Detalles Técnicos Clave
El modelo está disponible a través de la API Gemini y Vertex AI, y admite estas capacidades específicas:
- Texto: Admite contexto de hasta 8192 tokens de entrada
- Imágenes: Procesa hasta 6 imágenes por solicitud (formatos PNG y JPEG)
- Videos: Admite hasta 120 segundos de video de entrada (formatos MP4 y MOV)
- Audio: Ingresa e incrusta audio de forma nativa sin necesidad de transcripciones de texto
- Documentos: Incrusta directamente PDF de hasta 6 páginas de longitud
Más allá de procesar modalidades individuales, el modelo comprende de forma nativa la entrada intercalada, permitiéndote pasar múltiples modalidades (por ejemplo, imagen + texto) en una sola solicitud para capturar relaciones matizadas entre diferentes tipos de medios.
Dimensiones de Salida Flexibles
Gemini Embedding 2 incorpora Aprendizaje de Representación Matryoshka (MRL), permitiendo dimensiones de salida flexibles que se reducen desde el valor predeterminado de 3072. Esto permite a los desarrolladores equilibrar el rendimiento y los costos de almacenamiento. Google recomienda usar dimensiones de 3072, 1536 o 768 para la más alta calidad.
Integración y Casos de Uso
El modelo está diseñado para tareas multimodales posteriores, incluyendo Generación Aumentada por Recuperación (RAG), búsqueda semántica, análisis de sentimientos y agrupación de datos. Está disponible a través de múltiples plataformas:
- API Gemini
- Vertex AI
- LangChain, LlamaIndex, Haystack
- Bases de datos vectoriales: Weaviate, QDrant, ChromaDB y Vector Search
Google proporciona cuadernos interactivos de Colab para comenzar con las implementaciones de la API Gemini y Vertex AI.
📖 Read the full source: HN AI Agents
👀 Ver también

OpenAI y sus rivales publican plugins de agentes: un formato de paquete para agentes de IA
OpenAI, Amazon, Microsoft, Cursor y Vercel lanzaron Agent Plugins 1.0, un estándar abierto para empaquetar extensiones de agentes de IA. Crea una vez, ejecuta en ChatGPT, Codex, Copilot, Cursor y más.

Desarrolladores de Spotify aprovechando la IA para contribuciones sin código.
Los principales desarrolladores de Spotify no han escrito código desde diciembre debido a la IA, notablemente a través de su sistema interno 'Honk' que facilita implementaciones de código remotas y en tiempo real utilizando Claude Code.

Claude Code v2.1.163: Fijación de Versión, Lista de Plugins, Mejoras en Hooks y Correcciones Críticas de Errores
Claude Code v2.1.163 añade requiredMinimumVersion/requiredMaximumVersion en ajustes gestionados, el comando /plugin list, mejoras en el contexto de hooks y correcciones para cuelgues de claude -p, EEXIST en Windows y la regresión de Bazel/EDR.

Sistema del Agente OpenClaw Roto Después de Actualizaciones Recientes
Las actualizaciones recientes de OpenClaw han roto la funcionalidad central de los agentes, con usuarios reportando que los agentes no se pueden crear o ejecutar de manera confiable. El sistema anteriormente permitía crear agentes, que aparecían correctamente, ejecutar flujos de trabajo y usarlos para tareas reales.