Gemini Embedding 2: El Primer Modelo de Incrustación Nativamente Multimodal de Google Lanzado

Google DeepMind ha lanzado Gemini Embedding 2 en vista previa pública, su primer modelo de incrustación completamente multimodal construido sobre la arquitectura Gemini. A diferencia de los modelos anteriores solo de texto, este mapea texto, imágenes, videos, audio y documentos en un único espacio de incrustación unificado, capturando la intención semántica en más de 100 idiomas.
Detalles Técnicos Clave
El modelo está disponible a través de la API Gemini y Vertex AI, y admite estas capacidades específicas:
- Texto: Admite contexto de hasta 8192 tokens de entrada
- Imágenes: Procesa hasta 6 imágenes por solicitud (formatos PNG y JPEG)
- Videos: Admite hasta 120 segundos de video de entrada (formatos MP4 y MOV)
- Audio: Ingresa e incrusta audio de forma nativa sin necesidad de transcripciones de texto
- Documentos: Incrusta directamente PDF de hasta 6 páginas de longitud
Más allá de procesar modalidades individuales, el modelo comprende de forma nativa la entrada intercalada, permitiéndote pasar múltiples modalidades (por ejemplo, imagen + texto) en una sola solicitud para capturar relaciones matizadas entre diferentes tipos de medios.
Dimensiones de Salida Flexibles
Gemini Embedding 2 incorpora Aprendizaje de Representación Matryoshka (MRL), permitiendo dimensiones de salida flexibles que se reducen desde el valor predeterminado de 3072. Esto permite a los desarrolladores equilibrar el rendimiento y los costos de almacenamiento. Google recomienda usar dimensiones de 3072, 1536 o 768 para la más alta calidad.
Integración y Casos de Uso
El modelo está diseñado para tareas multimodales posteriores, incluyendo Generación Aumentada por Recuperación (RAG), búsqueda semántica, análisis de sentimientos y agrupación de datos. Está disponible a través de múltiples plataformas:
- API Gemini
- Vertex AI
- LangChain, LlamaIndex, Haystack
- Bases de datos vectoriales: Weaviate, QDrant, ChromaDB y Vector Search
Google proporciona cuadernos interactivos de Colab para comenzar con las implementaciones de la API Gemini y Vertex AI.
📖 Read the full source: HN AI Agents
👀 Ver también

Dos funcionarios sudafricanos de Asuntos de Interior suspendidos por alucinaciones de IA en un documento de política
Dos funcionarios fueron suspendidos después de que se encontraran alucinaciones de IA en la lista de referencias de un libro blanque revisado sobre ciudadanía, inmigración y protección de refugiados. El departamento implementará controles de IA y revisará todos los documentos políticos desde noviembre de 2022.

Pantheon-Reasoning-27B: Un modelo de RP de razonamiento denso de Gryphe
Gryphe lanza Pantheon-Reasoning-27B, un ajuste fino sin censura de Qwen 3.6 27B con trazas de razonamiento completas para juegos de rol. Construido sobre datos de Pantheon, Opus-4.6-Reasoning-24k, WorldSim, aventuras de texto y RP general. Cuantizaciones GGUF disponibles.

Codificación Slurm: El Patrón de Desarrollo Impulsado por IA Donde el Tiempo Desaparece
Un desarrollador describe la 'codificación Slurm' como un patrón de desarrollo intenso habilitado por herramientas de codificación con IA, donde pequeñas ideas escalan rápidamente a sistemas completos a través de un ciclo de retroalimentación de implementación rápida y descargas de dopamina.

En IA, el 41% depende del -59%
El economista jefe de Apollo desglosa los márgenes de beneficio de la IA por capas de la cadena de valor: Modelos y Aplicaciones registran un -59%, mientras que la parte alta de la cadena, como Silicio y Equipos, alcanza el 41%. El auge está financiado por inversores, no por clientes.