Googles DeepMind KI-Zeiger: Die Maus für Gemini-Interaktionen neu gedacht
Google DeepMind hat den KI-gesteuerten Zeiger vorgestellt, einen Prototypen, der den traditionellen Mauscursor mit Gemini-gestützter Kontexterkennung erweitert. Die Kernidee: Anstatt Inhalte in das Fenster eines KI-Tools zu ziehen, können Benutzer auf alles auf dem Bildschirm zeigen und einen Befehl in natürlicher Sprache geben (z. B. auf ein Gebäudebild zeigen und „Zeig mir den Weg“ sagen). Die KI versteht sowohl den visuellen als auch den semantischen Kontext und behandelt Pixel als handlungsfähige Entitäten (Orte, Daten, Objekte).
Vier Interaktionsprinzipien
- Den Fluss beibehalten: Die KI arbeitet app-übergreifend, nicht in einem separaten Fenster. Beispiele: auf ein PDF zeigen und eine Aufzählungspunkt-Zusammenfassung für eine E-Mail anfordern; über eine Tabelle fahren und ein Kreisdiagramm verlangen; ein Rezept hervorheben und „alle Zutaten verdoppeln“ sagen.
- Zeigen und Sagen: Der Zeiger erfasst den visuellen und semantischen Kontext, sodass Sie keine detaillierte Aufforderung benötigen. Zeigen Sie einfach, und die KI weiß, welches Wort, welcher Absatz, welcher Bildteil oder welcher Codeblock relevant ist.
- Die Macht von „Dies“ und „Das“ nutzen: Verwenden Sie natürliche Kurzformen wie „Behebe dies“, „Bewege das dorthin“ oder „Was bedeutet das?“ – die KI kombiniert Geste, Kontext und Sprache, um die Absicht zu ermitteln.
- Pixel in handlungsfähige Entitäten verwandeln: Ein Foto einer handschriftlichen Notiz wird zu einer interaktiven Aufgabenliste; ein pausierter Frame in einem Reisevideo wird zu einem Buchungslink für das gezeigte Restaurant.
Integration in Produkte
DeepMind führt diese Fähigkeiten an zwei Orten ein:
- Chrome (Gemini-Integration): Zeigen Sie auf einen Teil einer Webseite und fragen Sie Gemini danach. Beispiel: Wählen Sie einige Produkte aus und bitten Sie um einen Vergleich, oder zeigen Sie auf die Stelle, an der Sie ein neues Sofa visualisieren möchten.
- Googlebook (Magic Pointer): Eine bevorstehende Funktion für das Googlebook-Laptop, die Gemini „direkt zur Hand“ für intuitive Interaktionen bringt.
Experimentelle Demos sind auch in Google AI Studio verfügbar, um Bilder zu bearbeiten oder Orte auf einer Karte durch Zeigen und Sprechen zu finden. Das Team testet außerdem zukünftige Konzepte über die Disco-Plattform von Google Labs.
Für wen es gedacht ist: Entwickler, die KI-Agenten-Schnittstellen bauen, UX-Forscher und alle, die an Mensch-KI-Interaktionsmustern arbeiten.
📖 Read the full source: HN AI Agents
👀 Siehe auch

Konfigurationsänderungen mit Kimi 2.5 und Opus 4.6
Ein Benutzer bewertet die Leistung von Kimi 2.5 bei der Handhabung verschiedener Aufgaben, wobei der Fokus insbesondere auf seiner Fähigkeit liegt, Konfigurationsänderungen zu verwalten.

Bohrium AI Proteomik-Wettbewerb 2026 mit 13.000 $ Preisgeld und Rechenleistungsunterstützung
Bohrium veranstaltet einen KI-Proteomik-Wettbewerb im Jahr 2026 mit einem Preisgeld von 13.000 US-Dollar, Praktikumsmöglichkeiten und Rechenleistungsunterstützung. Der Wettbewerb wurde auf Hacker News mit 17 Punkten und 5 Kommentaren diskutiert.

Freund lehnt 300.000-Dollar-Job ab, der 70% der Belegschaft durch Claude-Agenten ersetzt — Reddit debattiert über moralische und technische Realität
Ein Reddit-Beitrag beschreibt einen Freund, der eine Stelle als 'AI Transition Lead' ablehnte, um Arbeitsabläufe zu kartieren, Claude/GPT-Agent-Pipelines zu erstellen und 70 % der Belegschaft zu entlassen. Der Poster argumentiert, dass der 300.000-Dollar-Deal es wert ist, Zeit zu verschwenden und zuzusehen, wie die C-Ebene in ihrer Illusion scheitert.

40M Tokens in einer Stunde: Nutzer berichtet von außer Kontrolle geratenen Subagenten mit OpenClaw
Ein OpenClaw-Nutzer berichtet von 40M Tokens in einer Stunde, nachdem Subagenten außer Kontrolle gerieten. Mit OpenRouter + DeepSeek Flash wurde das tägliche Budget aufgebraucht, bevor er eingreifen konnte. Er sucht nach Rate-Limitern und Schutzmaßnahmen.