Gemini Embedding 2: Первая нативная мультимодальная модель эмбеддингов от Google

✍️ OpenClawRadar📅 Опубликовано: 11 марта 2026 г.🔗 Source
Gemini Embedding 2: Первая нативная мультимодальная модель эмбеддингов от Google
Ad

Google DeepMind выпустила Gemini Embedding 2 в публичный предпросмотр — свою первую полностью мультимодальную модель эмбеддингов, построенную на архитектуре Gemini. В отличие от предыдущих моделей, работающих только с текстом, эта преобразует текст, изображения, видео, аудио и документы в единое, унифицированное пространство эмбеддингов, улавливая семантическое намерение на более чем 100 языках.

Ключевые технические детали

Модель доступна через Gemini API и Vertex AI и поддерживает следующие возможности:

  • Текст: Поддерживает контекст до 8192 входных токенов
  • Изображения: Обрабатывает до 6 изображений на запрос (форматы PNG и JPEG)
  • Видео: Поддерживает до 120 секунд видео (форматы MP4 и MOV)
  • Аудио: Нативно обрабатывает и создаёт эмбеддинги для аудио без необходимости текстовой транскрипции
  • Документы: Прямое создание эмбеддингов для PDF-файлов длиной до 6 страниц

Помимо обработки отдельных модальностей, модель нативно понимает чередующийся ввод, позволяя передавать несколько модальностей (например, изображение + текст) в одном запросе для улавливания тонких взаимосвязей между различными типами медиа.

Ad

Гибкие выходные размерности

Gemini Embedding 2 включает Matryoshka Representation Learning (MRL), что позволяет гибко масштабировать выходные размерности от стандартных 3072 вниз. Это позволяет разработчикам балансировать между производительностью и затратами на хранение. Google рекомендует использовать размерности 3072, 1536 или 768 для наивысшего качества.

Интеграция и варианты использования

Модель предназначена для мультимодальных задач, включая Retrieval-Augmented Generation (RAG), семантический поиск, анализ тональности и кластеризацию данных. Она доступна через несколько платформ:

  • Gemini API
  • Vertex AI
  • LangChain, LlamaIndex, Haystack
  • Векторные базы данных: Weaviate, QDrant, ChromaDB и Vector Search

Google предоставляет интерактивные Colab-блокноты для начала работы с реализациями Gemini API и Vertex AI.

📖 Read the full source: HN AI Agents

Ad

👀 Смотрите также

Рост экосистемы OpenClaw и ключевые участники на карте
Новости

Рост экосистемы OpenClaw и ключевые участники на карте

Участник сообщества составил карту стремительного расширения экосистемы OpenClaw, отметив более 230 тысяч звёзд на GitHub, более 116 тысяч участников в Discord и появление компаний в сферах управляемого хостинга, маршрутизации LLM и слоёв безопасности в течение 60 дней с момента запуска.

OpenClawRadar
NTSB изымает документы после того, как ИИ воссоздал голоса погибших пилотов по спектрограммам
Новости

NTSB изымает документы после того, как ИИ воссоздал голоса погибших пилотов по спектрограммам

Пользователи восстановили аудио из спектрограмм NTSB с помощью Codex и алгоритма Гриффина-Лима. NTSB закрыл публичный доступ к материалам.

OpenClawRadar
LeMario: Обучение мировой модели JEPA на Super Mario Bros — Техническое руководство и постмортем
Новости

LeMario: Обучение мировой модели JEPA на Super Mario Bros — Техническое руководство и постмортем

Бенджамин Бай воспроизводит архитектуру JEPA от LeWorldModel с нуля и обучает её на Super Mario Bros. Модель предсказывает пять шагов вперёд, но не справляется с долгосрочным планированием — подробный технический разбор.

OpenClawRadar
Обновление статуса Claude: Повышенный уровень ошибок для Opus 4.6 и Sonnet 4.6
Новости

Обновление статуса Claude: Повышенный уровень ошибок для Opus 4.6 и Sonnet 4.6

Официальное обновление статуса системы Claude сообщает о повышенном уровне ошибок для моделей Opus 4.6 и Sonnet 4.6, с инцидентом, датированным 2026-03-31T21:10:28.000Z. Автоматическое сообщение направляет пользователей на проверку статуса решения проблемы и отчетов о производительности сообщества.

OpenClawRadar