Coasty KI-Agent löst CAPTCHA-Herausforderungen bis Level 6 ohne Training

Coastys Computer Using Agent bewältigt echte Desktop-Herausforderungen
Coastys Computer Using Agent (CUA) hat gezeigt, dass er CAPTCHA-Herausforderungen bis Level 6 lösen kann, ohne speziell für "Ich bin kein Roboter"-Tests trainiert worden zu sein. Der Agent erreichte 82 % auf dem OSWorld-Benchmark, was Spitzenleistung für Computer-Nutzungs-Agenten in realen Desktop-Umgebungen darstellt.
Der Agent bewältigt verschiedene Web-Interface-Herausforderungen, die typischerweise andere Agenten zum Scheitern bringen, darunter:
- CAPTCHA-Herausforderungen bis Level 6
- Browser-Popups
- Cookie-Banner
Laut der Quelle haben die Entwickler den CUA nicht speziell zum Lösen von "Ich bin kein Roboter"-Herausforderungen trainiert und merken an, dass "die Ironie uns nicht entgeht". Die Leistung des Agenten deutet darauf hin, dass er allgemeine Computer-Interaktionsfähigkeiten entwickelt hat, anstatt spezialisierte Lösungen für einzelne Herausforderungstypen.
Ein Wiedergabelink ist für Interessierte verfügbar, die den Agenten in Aktion sehen möchten: https://coasty.ai/share/1cd404ae-3fcb-4d7f-b9d4-dac7aa26fc6d
📖 Read the full source: HN AI Agents
👀 Siehe auch

Spotify führt „Verifiziert“-Badges ein, um menschliche Künstler von KI-generierten Acts zu unterscheiden
Spotify führt ein grünes Häkchen 'Verified by Spotify' für Künstlerprofile ein, die Kriterien wie verknüpfte soziale Konten, Konzerttermine oder Merchandise erfüllen, um menschliche Acts von KI-generierten zu unterscheiden.

Forschung: KI 'entbündelt' Arbeitsplätze in engere, schlechter bezahlte Aufgaben
Ein neues Papier argumentiert, dass KI nicht direkt Arbeitsplätze abschafft, sondern sie in engere Aufgaben 'entbündelt', wobei schwache-Bündel-Berufe einen reduzierten Umfang und Lohn sehen, während starke-Bündel-Jobs Leistungsverbesserungen erfahren können.

Feinabgestimmte Qwen3-Kleinstmodelle übertreffen Spitzen-LLMs bei spezifischen Aufgaben zu geringeren Kosten
Destillierte Qwen3-Modelle (0,6B bis 8B Parameter) übertrafen oder erreichten Spitzen-API-Modelle wie GPT-5, Gemini und Claude bei 6 von 9 Aufgaben, einschließlich Funktionsaufrufen und Text2SQL, mit Kosten von nur 3 US-Dollar pro Million Anfragen gegenüber 378 US-Dollar für vergleichbare Leistung.

Tokenmaxxing ist die neue Stoppuhr: Warum Ihre KI-Richtlinie kohärent sein muss
Brian Meeker argumentiert gegen Eitelkeitsmetriken wie Tokenmaxxing und teilt die Vier-Punkte-KI-Politik seines Teams: kein Zwang, generierten Code verstehen, ohne KI-Tools überlebensfähig sein, sich um Teamkollegen und Kunden kümmern.