Googles Nano Banana 2 KI-Bildmodell: Funktionen und Verfügbarkeit

Was Nano Banana 2 ist
Google DeepMind hat Nano Banana 2 (Gemini 3.1 Flash Image) auf den Markt gebracht, ein neues KI-Bildgenerierungsmodell, das die fortschrittlichen Fähigkeiten von Nano Banana Pro mit der hohen Geschwindigkeit von Gemini Flash vereint. Dieses Modell ist für schnelleres Bearbeiten und Iterieren in Bildbearbeitungs-Workflows konzipiert.
Hauptmerkmale und Spezifikationen
Nano Banana 2 umfasst mehrere spezifische technische Verbesserungen und Funktionen:
- Fortschrittliches Weltwissen: Greift auf Geminis Wissensbasis der realen Welt zurück und nutzt Echtzeitinformationen aus der Websuche, um bestimmte Subjekte präzise darzustellen. Dies ermöglicht die Erstellung von Infografiken, Diagrammen aus Notizen und Datenvisualisierungen.
- Präzise Textwiedergabe und Übersetzung: Erzeugt genauen, lesbaren Text für Marketing-Mockups oder Grußkarten und kann Text innerhalb von Bildern übersetzen/lokalisieren.
- Subjektkonsistenz: Bewahrt die Ähnlichkeit von Charakteren für bis zu fünf Figuren und die Treue für bis zu 14 Objekte in einem einzigen Workflow, was Storyboarding ermöglicht, ohne das Erscheinungsbild der Eingaben zu verändern.
- Präzise Befolgung von Anweisungen: Hält sich strenger an komplexe Anfragen, um spezifische Nuancen von Ideen einzufangen.
- Produktionsreife Spezifikationen: Unterstützt verschiedene Seitenverhältnisse und Auflösungen von 512px bis 4K für verschiedene Formate wie vertikale Social-Media-Beiträge oder Breitbild-Hintergründe.
- Visuelle Qualitätsverbesserung: Liefert lebendige Beleuchtung, reichhaltigere Texturen und schärfere Details bei gleichbleibender Flash-Geschwindigkeit.
Verfügbarkeit und Integration
Das Modell wird schrittweise in Google-Produkten eingeführt, darunter die Gemini-App, Google Suche und Google Ads. Google verbessert außerdem seine SynthID-Technologie mit C2PA Content Credentials, um KI-generierte Inhalte zu identifizieren.
📖 Read the full source: HN AI Agents
👀 Siehe auch

Benchmark-Ergebnisse für visuelles Denken von 15 multimodalen KI-Modellen
AIMultiple hat 15 führende multimodale KI-Modelle anhand von 200 visuellen Verständnisfragen in zwei Kategorien getestet: Diagrammverständnis und visuelle Logik. Gemini-3.1-pro-preview und Gemini-3-pro-preview führen die Gesamtergebnisse an, gefolgt von GPT-5.2, Kimi-K2.5 und GPT-5.2-pro.

Claude vs GPT-4o: Gleicher Doppelpendel-Prompt, unterschiedliche Koordinatenkonventionen
Claude und GPT-4o erzeugen visuell unterschiedliche Doppelpendelsimulationen, weil sie Theta von entgegengesetzten Vertikalen interpretieren – oben vs. unten – während sie denselben Renderer verwenden. Die Mathematik ist in beiden Fällen korrekt, aber die Diskrepanz offenbart eine subtile Mehrdeutigkeit in der Prompt-Interpretation.

OpenClaw 2026.6.5: Kostenlose Parallelsuche, Stabilitätsbehebungen auf ganzer Linie
OpenClaw 2026.6.5 fügt kostenlose, einrichtungsfreie Parallel-Suche, sicherere Kanalantworten, bessere Agentenlauf-Wiederherstellung und weniger fehleranfällige Anbieter-/Modellkonfiguration hinzu.

Anthropic veröffentlicht KI-Tool zur Analyse von COBOL-Codebasen, IBM-Aktie fällt um 13 %.
Anthropic hat ein KI-Tool veröffentlicht, das COBOL-Codebasen analysiert, um Risiken zu kennzeichnen und Modernisierungskosten zu senken. Die Ankündigung löste einen Kursrückgang von 13 % bei IBM aus, da der Markt dies als Bedrohung für IBMs Geschäft mit der Verwaltung von Altsystemen wahrnahm.