Gemini Embedding 2: O Primeiro Modelo de Embedding Nativamente Multimodal da Google Lançado

O Google DeepMind lançou o Gemini Embedding 2 em prévia pública, seu primeiro modelo de embedding totalmente multimodal construído na arquitetura Gemini. Diferente dos modelos anteriores apenas de texto, este mapeia texto, imagens, vídeos, áudio e documentos em um único espaço de embedding unificado, capturando a intenção semântica em mais de 100 idiomas.
Principais Detalhes Técnicos
O modelo está disponível através da API Gemini e Vertex AI, e suporta estas capacidades específicas:
- Texto: Suporta contexto de até 8192 tokens de entrada
- Imagens: Processa até 6 imagens por solicitação (formatos PNG e JPEG)
- Vídeos: Suporta até 120 segundos de entrada de vídeo (formatos MP4 e MOV)
- Áudio: Ingesta e incorpora áudio nativamente sem precisar de transcrições de texto
- Documentos: Incorpora diretamente PDFs de até 6 páginas
Além de processar modalidades individuais, o modelo compreende nativamente entrada intercalada, permitindo que você passe múltiplas modalidades (por exemplo, imagem + texto) em uma única solicitação para capturar relações sutis entre diferentes tipos de mídia.
Dimensões de Saída Flexíveis
O Gemini Embedding 2 incorpora o Aprendizado de Representação Matryoshka (MRL), permitindo dimensões de saída flexíveis que escalam a partir do padrão 3072. Isso permite que os desenvolvedores equilibrem desempenho e custos de armazenamento. O Google recomenda usar 3072, 1536 ou 768 dimensões para a mais alta qualidade.
Integração e Casos de Uso
O modelo é projetado para tarefas multimodais subsequentes, incluindo Geração Aumentada por Recuperação (RAG), busca semântica, análise de sentimentos e agrupamento de dados. Está disponível através de múltiplas plataformas:
- API Gemini
- Vertex AI
- LangChain, LlamaIndex, Haystack
- Bancos de dados vetoriais: Weaviate, QDrant, ChromaDB e Vector Search
O Google fornece notebooks interativos do Colab para começar com as implementações da API Gemini e Vertex AI.
📖 Leia a fonte completa: HN AI Agents
👀 See Also

Gemini 3 Flash: Aumento de Desempenho com Prompting Competitivo
Pesquisadores alcançaram 95% do desempenho de referência do Claude 4.6 Opus com o Gemini 3 Flash a 1/200 do custo e 4 vezes a velocidade, usando técnicas de prompt competitivas que aproveitaram a inveja humana como motivação.

Claude Code v2.1.232: Bifurcação de Subagentes, Suporte ao GitLab e Correções de Segurança
O Claude Code v2.1.232 ativa o fork de subagentes por padrão, adiciona suporte ao GitLab nos marketplaces de plugins e corrige várias vulnerabilidades de segurança, incluindo contornos no PowerShell e em links simbólicos.
O Risco Mundano: Por que as Maiores Ameaças da Segurança da IA são Entediantes, não Dramáticas
Um ensaio argumenta que falhas mundanas de IA já estão causando danos em escala, as abordagens atuais de alinhamento dependem excessivamente de ambientes isolados, e a convergência de capacidades torna a exposição acidental ao mundo real cada vez mais plausível.

Extensão do Claude Code para IDE falha ao carregar no Windows – Atualização de Status
Uma atualização oficial de status informa que a extensão Claude Code IDE não consegue carregar no Windows a partir de 2026-05-08T22:32:19Z. Acompanhe o progresso e a resolução através da página de status.