TinyFish Web Agent übertrifft Wettbewerber bei der Web-Task-Benchmarking.

Der TinyFish Web Agent hat sich als führendes Tool zur Bewältigung komplexer Web-Aufgaben erwiesen und erreichte eine Erfolgsquote von 81,9 % bei schwierigen Aufgaben im Online-Mind2Web-Benchmark, der aus 300 Aufgaben auf 136 aktiven Websites besteht. Diese Zahl steht im krassen Gegensatz zu wichtigen Wettbewerbern wie OpenAI Operator, der nur eine Erfolgsquote von 43,2 % bei ähnlichen Aufgaben erzielte.
Der Online-Mind2Web-Benchmark ist ein strenges Maß für die Fähigkeiten eines Web-Agenten und testet sie bei Aufgaben, die von einfachen, wie dem Durchstöbern von Kreditkartenangeboten bei Marriott, bis hin zu komplexen Herausforderungen, wie der Buchung von Veranstaltungstickets mit dynamischer Preissetzung, reichen. Die Aufgaben umfassen mehrere Schritte mit aktiven Websites, darunter das Handling von Formularvalidierungen und Pop-ups, was es zu einem realistischen Test im Vergleich zu anderen weniger zuverlässigen Benchmarks wie WebVoyager macht.
TinyFish zeichnet sich dadurch aus, dass es kumulierte Fehler effektiv handhabt. Es verliert nur 15,6 Punkte von einfachen zu schwierigen Aufgaben im Vergleich zu massiven Einbrüchen, die andere Systeme zeigen, was seine Robustheit in realen Szenarien hervorhebt. Erwähnenswert ist, dass es alle 300 Aufgabenausführungen veröffentlicht hat, einschließlich der 40 Fehlschläge, was Transparenz über seine Leistungsmerkmale und Fehlerfälle bietet, wie zum Beispiel Infrastruktur-Blockaden auf Websites wie apartments.com.
Entwickler, die nach einem robusten Tool zur Webautomatisierung suchen, könnten an TinyFishs Open-Source-Kochbuch-Repository interessiert sein, das Einblicke in seine Architektur und Ausführungsmethodik bietet.
📖 Lesen Sie die vollständige Quelle: HN AI Agents
👀 Siehe auch

Spectr: Ein MCP, das App-Spezifikationen aus Bildschirmaufnahmen für pixelgenaue Claude-Klone schreibt
Spectr ist ein MCP-Server, CLI und Claude Code Skill, der eine .mp4/.mov-Bildschirmaufnahme einer iOS-App nimmt und eine 7-teilige spec.md mit Hex-Codes, Schriftgewichten, Abständen, Übergängen und Navigationsgraphen generiert – und damit die 30-minütige manuelle Spezifikation pro Bildschirm überflüssig macht.

Allgemeine Bots: Open-Source-KI-Agenten-Plattform für selbst gehostete Unternehmensautomatisierung
General Bots ist eine Open-Source-Plattform, die 2019 gestartet wurde und KI-Agenten, Workflow-Automatisierung, Dokumentenverarbeitung und Integrationen mit Unterstützung für lokale KI-Modelle bietet. Sie wurde für Organisationen entwickelt, die volle Kontrolle über ihre Infrastruktur benötigen.

Werld: Offene künstliche Lebenssimulation mit sich entwickelnden neuronalen Netzen
Werld ist eine Echtzeit-Simulation künstlichen Lebens, bei der Agenten mit NEAT-Neuronalen Netzen ihre eigene neuronale Architektur, sensorische Verarbeitung und Verhaltensweisen entwickeln, ohne fest kodierte Regeln oder Belohnungsfunktionen. Die Simulation beginnt mit 30 Agenten auf einem Watts-Strogatz-Kleinstwelt-Graphen mit 64 sensorischen Kanälen, 7 kontinuierlichen Motorfunktionen und 29 vererbbaren Genommerkmalen.

SendToAI VS Code Extension löst Claudes 20-Dateien-Limit durch Projekt-Bündelung
SendToAI ist eine kostenlose VS Code-Erweiterung, die gesamte Projekte in einen einzigen Zwischenablage-Einfügevorgang bündelt und so Claudes Limit von 20 Datei-Uploads umgeht. Sie bietet visuelle Dateiauswahl, Token-Zählung, Kostenabschätzungen und projektbezogene Notizen, die über Sitzungen hinweg erhalten bleiben.