Googles DeepMind KI-Zeiger: Die Maus für Gemini-Interaktionen neu gedacht
Google DeepMind hat den KI-gesteuerten Zeiger vorgestellt, einen Prototypen, der den traditionellen Mauscursor mit Gemini-gestützter Kontexterkennung erweitert. Die Kernidee: Anstatt Inhalte in das Fenster eines KI-Tools zu ziehen, können Benutzer auf alles auf dem Bildschirm zeigen und einen Befehl in natürlicher Sprache geben (z. B. auf ein Gebäudebild zeigen und „Zeig mir den Weg“ sagen). Die KI versteht sowohl den visuellen als auch den semantischen Kontext und behandelt Pixel als handlungsfähige Entitäten (Orte, Daten, Objekte).
Vier Interaktionsprinzipien
- Den Fluss beibehalten: Die KI arbeitet app-übergreifend, nicht in einem separaten Fenster. Beispiele: auf ein PDF zeigen und eine Aufzählungspunkt-Zusammenfassung für eine E-Mail anfordern; über eine Tabelle fahren und ein Kreisdiagramm verlangen; ein Rezept hervorheben und „alle Zutaten verdoppeln“ sagen.
- Zeigen und Sagen: Der Zeiger erfasst den visuellen und semantischen Kontext, sodass Sie keine detaillierte Aufforderung benötigen. Zeigen Sie einfach, und die KI weiß, welches Wort, welcher Absatz, welcher Bildteil oder welcher Codeblock relevant ist.
- Die Macht von „Dies“ und „Das“ nutzen: Verwenden Sie natürliche Kurzformen wie „Behebe dies“, „Bewege das dorthin“ oder „Was bedeutet das?“ – die KI kombiniert Geste, Kontext und Sprache, um die Absicht zu ermitteln.
- Pixel in handlungsfähige Entitäten verwandeln: Ein Foto einer handschriftlichen Notiz wird zu einer interaktiven Aufgabenliste; ein pausierter Frame in einem Reisevideo wird zu einem Buchungslink für das gezeigte Restaurant.
Integration in Produkte
DeepMind führt diese Fähigkeiten an zwei Orten ein:
- Chrome (Gemini-Integration): Zeigen Sie auf einen Teil einer Webseite und fragen Sie Gemini danach. Beispiel: Wählen Sie einige Produkte aus und bitten Sie um einen Vergleich, oder zeigen Sie auf die Stelle, an der Sie ein neues Sofa visualisieren möchten.
- Googlebook (Magic Pointer): Eine bevorstehende Funktion für das Googlebook-Laptop, die Gemini „direkt zur Hand“ für intuitive Interaktionen bringt.
Experimentelle Demos sind auch in Google AI Studio verfügbar, um Bilder zu bearbeiten oder Orte auf einer Karte durch Zeigen und Sprechen zu finden. Das Team testet außerdem zukünftige Konzepte über die Disco-Plattform von Google Labs.
Für wen es gedacht ist: Entwickler, die KI-Agenten-Schnittstellen bauen, UX-Forscher und alle, die an Mensch-KI-Interaktionsmustern arbeiten.
📖 Read the full source: HN AI Agents
👀 Siehe auch

OpenRouters Heiler-Alpha-Stealth-Modell scheint eine unveröffentlichte Variante von Qwen 3.5-Omni zu sein.
OpenRouter hat ein kostenloses anonymes omni-modales Modell namens Healer Alpha mit einem Kontextfenster von 262.144 und multimodalen Fähigkeiten bereitgestellt. Forensische Analysen deuten darauf hin, dass es sich um eine unveröffentlichte Qwen 3.5-Omni-Variante von Alibaba handelt.

Claude Opus 4.7 Modellkarte veröffentlicht
Anthropic hat die Claude Opus 4.7 Modellkarte veröffentlicht, die technische Dokumentation für ihr neuestes KI-Modell bereitstellt. Das Quellenmaterial scheint ein PDF-Dokument mit Systemanforderungen und technischen Details zu sein.

Claude Code v2.1.200: Wichtige Fehlerbehebungen und Änderungen am Berechtigungsmodus
Claude Code v2.1.200 ändert AskUserQuestion-Dialoge, damit sie nicht mehr automatisch fortfahren, schaltet den Standard-Berechtigungsmodus auf Manuell und behebt Abstürze von Hintergrund-Agenten sowie Korruption der Roster-Daten.

Prozessrisiken bei Finanzierungsstrukturen für KI-Rechenzentren
Der Ausbau von KI-Rechenzentren erfordert bis 2030 Investitionen in Höhe von 5,2 Billionen US-Dollar in die Infrastruktur. Unternehmen nutzen komplexe Finanzierungsstrukturen wie Zweckgesellschaften (SPVs) und GPU-besicherte Kreditfazilitäten, die neun Kategorien von Klagerisiken mit sich bringen.