Gemini Embedding 2: Первая нативная мультимодальная модель эмбеддингов от Google

Google DeepMind выпустила Gemini Embedding 2 в публичный предпросмотр — свою первую полностью мультимодальную модель эмбеддингов, построенную на архитектуре Gemini. В отличие от предыдущих моделей, работающих только с текстом, эта преобразует текст, изображения, видео, аудио и документы в единое, унифицированное пространство эмбеддингов, улавливая семантическое намерение на более чем 100 языках.
Ключевые технические детали
Модель доступна через Gemini API и Vertex AI и поддерживает следующие возможности:
- Текст: Поддерживает контекст до 8192 входных токенов
- Изображения: Обрабатывает до 6 изображений на запрос (форматы PNG и JPEG)
- Видео: Поддерживает до 120 секунд видео (форматы MP4 и MOV)
- Аудио: Нативно обрабатывает и создаёт эмбеддинги для аудио без необходимости текстовой транскрипции
- Документы: Прямое создание эмбеддингов для PDF-файлов длиной до 6 страниц
Помимо обработки отдельных модальностей, модель нативно понимает чередующийся ввод, позволяя передавать несколько модальностей (например, изображение + текст) в одном запросе для улавливания тонких взаимосвязей между различными типами медиа.
Гибкие выходные размерности
Gemini Embedding 2 включает Matryoshka Representation Learning (MRL), что позволяет гибко масштабировать выходные размерности от стандартных 3072 вниз. Это позволяет разработчикам балансировать между производительностью и затратами на хранение. Google рекомендует использовать размерности 3072, 1536 или 768 для наивысшего качества.
Интеграция и варианты использования
Модель предназначена для мультимодальных задач, включая Retrieval-Augmented Generation (RAG), семантический поиск, анализ тональности и кластеризацию данных. Она доступна через несколько платформ:
- Gemini API
- Vertex AI
- LangChain, LlamaIndex, Haystack
- Векторные базы данных: Weaviate, QDrant, ChromaDB и Vector Search
Google предоставляет интерактивные Colab-блокноты для начала работы с реализациями Gemini API и Vertex AI.
📖 Read the full source: HN AI Agents
👀 Смотрите также

Рост экосистемы OpenClaw и ключевые участники на карте
Участник сообщества составил карту стремительного расширения экосистемы OpenClaw, отметив более 230 тысяч звёзд на GitHub, более 116 тысяч участников в Discord и появление компаний в сферах управляемого хостинга, маршрутизации LLM и слоёв безопасности в течение 60 дней с момента запуска.

NTSB изымает документы после того, как ИИ воссоздал голоса погибших пилотов по спектрограммам
Пользователи восстановили аудио из спектрограмм NTSB с помощью Codex и алгоритма Гриффина-Лима. NTSB закрыл публичный доступ к материалам.

LeMario: Обучение мировой модели JEPA на Super Mario Bros — Техническое руководство и постмортем
Бенджамин Бай воспроизводит архитектуру JEPA от LeWorldModel с нуля и обучает её на Super Mario Bros. Модель предсказывает пять шагов вперёд, но не справляется с долгосрочным планированием — подробный технический разбор.

Обновление статуса Claude: Повышенный уровень ошибок для Opus 4.6 и Sonnet 4.6
Официальное обновление статуса системы Claude сообщает о повышенном уровне ошибок для моделей Opus 4.6 и Sonnet 4.6, с инцидентом, датированным 2026-03-31T21:10:28.000Z. Автоматическое сообщение направляет пользователей на проверку статуса решения проблемы и отчетов о производительности сообщества.