Gemini Embedding 2: Googles erstes nativ multimodales Embedding-Modell veröffentlicht

Google DeepMind hat Gemini Embedding 2 in der öffentlichen Vorschau veröffentlicht, ihr erstes vollständig multimodales Embedding-Modell, das auf der Gemini-Architektur aufbaut. Im Gegensatz zu früheren reinen Textmodellen bildet dieses Text, Bilder, Videos, Audio und Dokumente in einen einzigen, vereinheitlichten Embedding-Raum ab und erfasst semantische Absichten über mehr als 100 Sprachen hinweg.
Wichtige technische Details
Das Modell ist über die Gemini API und Vertex AI verfügbar und unterstützt diese spezifischen Fähigkeiten:
- Text: Unterstützt Kontexte von bis zu 8192 Eingabe-Tokens
- Bilder: Verarbeitet bis zu 6 Bilder pro Anfrage (PNG- und JPEG-Formate)
- Videos: Unterstützt bis zu 120 Sekunden Videoeingabe (MP4- und MOV-Formate)
- Audio: Verarbeitet und embeddet Audio nativ, ohne Texttranskriptionen zu benötigen
- Dokumente: Embeddet PDFs mit bis zu 6 Seiten Länge direkt
Über die Verarbeitung einzelner Modalitäten hinaus versteht das Modell nativ verschachtelte Eingaben, sodass Sie mehrere Modalitäten (z.B. Bild + Text) in einer einzigen Anfrage übergeben können, um nuancenreiche Beziehungen zwischen verschiedenen Medientypen zu erfassen.
Flexible Ausgabedimensionen
Gemini Embedding 2 integriert Matryoshka Representation Learning (MRL), was flexible Ausgabedimensionen ermöglicht, die von den standardmäßigen 3072 herunterskaliert werden können. Dies ermöglicht Entwicklern, Leistung und Speicherkosten auszubalancieren. Google empfiehlt die Verwendung von 3072, 1536 oder 768 Dimensionen für die höchste Qualität.
Integration und Anwendungsfälle
Das Modell ist für multimodale Downstream-Aufgaben konzipiert, einschließlich Retrieval-Augmented Generation (RAG), semantische Suche, Sentiment-Analyse und Daten-Clustering. Es ist über mehrere Plattformen verfügbar:
- Gemini API
- Vertex AI
- LangChain, LlamaIndex, Haystack
- Vektordatenbanken: Weaviate, QDrant, ChromaDB und Vector Search
Google stellt interaktive Colab-Notebooks für den Einstieg in die Gemini API und Vertex AI-Implementierungen bereit.
📖 Read the full source: HN AI Agents
👀 Siehe auch

Claude Code v2.1.216: Sandbox-Dateisystem-Umschaltung, Behebung einer quadratischen Verlangsamung und über 30 Fehlerkorrekturen
Claude Code v2.1.216 fügt sandbox.filesystem.disabled hinzu, um die Dateisystemisolierung zu überspringen, während die Netzwerkausgangskontrolle erhalten bleibt, behebt eine quadratische Verlangsamung der Nachrichtennormalisierung in langen Sitzungen und löst über 30 Fehler, darunter OAuth-Token-Ablauf, Worktree-Isolierung und Persistenz von Hintergrundagenten.

Anthropic liefert 1-Million-Token-Kontextfenster für Claude Opus ohne Aufpreis aus.
Anthropic hat das 1-Million-Token-Kontextfenster für alle Claude Code-Benutzer auf Max-, Team- und Enterprise-Tarifen in Version 2.1.75 verfügbar gemacht und die bisherigen zusätzlichen Nutzungsgebühren abgeschafft. Das Standardfenster bleibt bei 200.000 Tokens.

Claude Code System Prompts v2.1.53-2.1.55: Speicherauswahl hinzugefügt, Befehlsausführung entfernt
Claude Code Systemprompt-Versionen 2.1.53 bis 2.1.55 fügen Speicherauswahlanweisungen hinzu (156 Token), entfernen den Befehlausführungsspezialisten (109 Token) und strukturieren Prompts in etwa 70 atomare Dateien um. Hintergrundagenten benachrichtigen jetzt automatisch bei Abschluss, anstatt Ausgabedateipfade bereitzustellen.

Apple Silicon Benchmark: Leistung von Qwen3-VL auf M3, M4 und M5 Max für Vision-LLM-Klassifizierung
Benchmark-Ergebnisse zeigen die Klassifizierungsleistung des Qwen3-VL Vision-LLM auf Apple Silicon: M3 Max und M4 Studio sind bei 8B-Modellen nahezu identisch, während der M5 Max 75-83 % schneller ist. Die Speicherbandbreite ist für die Token-Generierung wichtiger als für das Prefill bei Vision-Aufgaben.