ジェミニ エンベディング 2: Google初のネイティブマルチモーダル埋め込みモデルがリリース

Google DeepMindは、Geminiアーキテクチャを基に構築された初の完全マルチモーダル埋め込みモデルであるGemini Embedding 2をパブリックプレビューでリリースしました。従来のテキスト専用モデルとは異なり、このモデルはテキスト、画像、動画、音声、文書を単一の統一された埋め込み空間にマッピングし、100以上の言語にわたる意味的意図を捉えます。
主要な技術詳細
このモデルはGemini APIおよびVertex AIを通じて利用可能で、以下の特定の機能をサポートしています:
- テキスト: 最大8192入力トークンのコンテキストをサポート
- 画像: リクエストごとに最大6枚の画像を処理(PNGおよびJPEG形式)
- 動画: 最大120秒の動画入力をサポート(MP4およびMOV形式)
- 音声: テキスト書き起こしを必要とせずにネイティブで音声を取り込み埋め込み
- 文書: 最大6ページのPDFを直接埋め込み
単一モダリティの処理に加えて、このモデルはインターリーブされた入力をネイティブで理解し、複数のモダリティ(例:画像+テキスト)を単一リクエストで渡して、異なるメディアタイプ間の微妙な関係を捉えることができます。
柔軟な出力次元
Gemini Embedding 2はMatryoshka Representation Learning(MRL)を組み込んでおり、デフォルトの3072からスケールダウンする柔軟な出力次元を可能にします。これにより、開発者はパフォーマンスとストレージコストのバランスを取ることができます。Googleは最高品質のために3072、1536、または768次元の使用を推奨しています。
統合とユースケース
このモデルは、Retrieval-Augmented Generation(RAG)、セマンティック検索、感情分析、データクラスタリングなどのマルチモーダル下流タスク向けに設計されています。以下の複数のプラットフォームで利用可能です:
- Gemini API
- Vertex AI
- LangChain、LlamaIndex、Haystack
- ベクトルデータベース:Weaviate、QDrant、ChromaDB、Vector Search
Googleは、Gemini APIおよびVertex AIの実装を始めるためのインタラクティブなColabノートブックを提供しています。
📖 Read the full source: HN AI Agents
👀 See Also

OpenClawユーザーは、曖昧なプロンプトによる高いAPIコストを報告しており、開発者は構造化されたワークフローを推奨しています。
Redditユーザーが、曖昧なプロンプトによりOpenClawから300ドルのAnthropic請求を受けたと報告。コミュニティは、オーケストレーターは願望的な思考に対する『魔法のランプ』ではなく、明確な意図と構造化されたワークフローで最も効果的に機能すると指摘。

OpenClaw 4月アップデート: 破壊的変更と信頼低下の1ヶ月
OpenClawの4月のアップデートは、新機能と修正が重大なバグと一緒にリリースされるパターンを示している。インストール後スクリプトによるファイル削除、セキュリティホール、壊れたスキルが信頼を損なっている。

Stripeのミニオン:ワンショットエンドツーエンドコーディングエージェントによる開発者生産性の向上
Stripe Minionsは、Stripeエコシステム内の複雑なタスクを自動化することで開発者の生産性を向上させるために設計された、ワンショットのエンドツーエンドコーディングエージェントです。

クロードコードサブエージェントはマルチエージェントシステムでスキルを読み込まない
開発者が報告したところによると、Claude Code v2.1.91のサブエージェントは.claude/skills/ディレクトリで定義されたスキルにアクセスできず、メインセッションではスキルが完璧に動作しているとのことです。エージェントのフロントマターでのスキル指定、Skillツール、CLIフラグ、Agent Teamsなど、複数のアプローチがすべて失敗しています。