ジェミニ エンベディング 2: Google初のネイティブマルチモーダル埋め込みモデルがリリース

Google DeepMindは、Geminiアーキテクチャを基に構築された初の完全マルチモーダル埋め込みモデルであるGemini Embedding 2をパブリックプレビューでリリースしました。従来のテキスト専用モデルとは異なり、このモデルはテキスト、画像、動画、音声、文書を単一の統一された埋め込み空間にマッピングし、100以上の言語にわたる意味的意図を捉えます。
主要な技術詳細
このモデルはGemini APIおよびVertex AIを通じて利用可能で、以下の特定の機能をサポートしています:
- テキスト: 最大8192入力トークンのコンテキストをサポート
- 画像: リクエストごとに最大6枚の画像を処理(PNGおよびJPEG形式)
- 動画: 最大120秒の動画入力をサポート(MP4およびMOV形式)
- 音声: テキスト書き起こしを必要とせずにネイティブで音声を取り込み埋め込み
- 文書: 最大6ページのPDFを直接埋め込み
単一モダリティの処理に加えて、このモデルはインターリーブされた入力をネイティブで理解し、複数のモダリティ(例:画像+テキスト)を単一リクエストで渡して、異なるメディアタイプ間の微妙な関係を捉えることができます。
柔軟な出力次元
Gemini Embedding 2はMatryoshka Representation Learning(MRL)を組み込んでおり、デフォルトの3072からスケールダウンする柔軟な出力次元を可能にします。これにより、開発者はパフォーマンスとストレージコストのバランスを取ることができます。Googleは最高品質のために3072、1536、または768次元の使用を推奨しています。
統合とユースケース
このモデルは、Retrieval-Augmented Generation(RAG)、セマンティック検索、感情分析、データクラスタリングなどのマルチモーダル下流タスク向けに設計されています。以下の複数のプラットフォームで利用可能です:
- Gemini API
- Vertex AI
- LangChain、LlamaIndex、Haystack
- ベクトルデータベース:Weaviate、QDrant、ChromaDB、Vector Search
Googleは、Gemini APIおよびVertex AIの実装を始めるためのインタラクティブなColabノートブックを提供しています。
📖 Read the full source: HN AI Agents
👀 See Also

sseanliu/VisionClawがMeta Ray-BanスマートグラスにリアルタイムAIアシスタンスをもたらす
sseanliuのVisionClawは、Gemini LiveとOpenClawを活用した音声、視覚、エージェント機能を統合した革新的なAIアシスタントで、Meta Ray-Banスマートグラスに革命をもたらします。

Claude CodeがQNXのビッグカーネルロック解除に挑戦、ユーザースペースの競合統計から着手
開発者がClaude CodeにQNXマイクロカーネルを再設計してBig Kernel Lockを除去するよう依頼しました。Claudeはトップクラスの人間の開発者なら3ヶ月かかると見積もり、まず/procのようなロック統計を設計し、カーネルサブシステムを一つずつ修正し始めました。

Gemma 4 31Bは、FoodTruck Benchにおいてより大規模なモデルを凌駕する性能を発揮します。
Gemma 4 31BはFoodTruck Benchベンチマークで3位を獲得し、GLM 5、Qwen 3.5 397B、およびすべてのClaude Sonnetモデルを上回りました。このモデルは長期的なタスクをより適切に処理し、自身の計画アドバイスに従うようです。

GoogleのTimesFM 2.5:16000トークンのコンテキストを持つ2億パラメータの時系列モデル
Google Researchは、16kのコンテキスト長と最大1kの予測期間までの連続的分位点予測を備えた、時系列予測用の2億パラメータのデコーダのみの基盤モデル「TimesFM 2.5」をリリースしました。