TinyFish Web Agent、Webタスクベンチマークで競合を上回る

TinyFishウェブエージェントは、複雑なウェブタスクの解決において優れたツールであることが証明され、136のライブウェブサイトにわたる300のタスクからなるOnline-Mind2Webベンチマークにおいて、困難なタスクで81.9%の成功率を達成しました。この数値は、OpenAI Operatorのような主要な競合が同様のタスクでわずか43.2%の成功率しか達成できなかったことと、鮮明に対照的です。
Online-Mind2Webベンチマークは、ウェブエージェントの能力を厳密に測定するもので、マリオットでのクレジットカードオファーの閲覧といった簡単なタスクから、動的価格設定でのイベントチケット予約といった複雑な課題まで、幅広いタスクでテストします。タスクには、フォーム検証やポップアップの処理を含むライブウェブサイトでの複数ステップが含まれており、WebVoyagerのような信頼性の低い他のベンチマークと比較して現実的なテストとなっています。
TinyFishは、複合エラーを効果的に処理することで他と差別化しています。簡単なタスクから困難なタスクへの低下はわずか15.6ポイントであり、他のシステムに見られる大幅な低下と比べて、実世界のシナリオにおける堅牢性が際立っています。特に、apartments.comのようなサイトで遭遇したインフラレベルのアンチボットブロックを含む40の失敗例も含む、300のタスク実行すべてを公開しており、その性能特性と失敗ケースについて透明性を提供しています。
堅牢なウェブ自動化ツールを探している開発者は、TinyFishのオープンソースクックブックリポジトリに興味を持つでしょう。これは、そのアーキテクチャと実行方法論に関する洞察を提供します。
📖 全文を読む: HN AI Agents
👀 See Also
針:完全不需要前馈网络构建的2600万参数工具调用模型
Needleは、MLPを持たない2600万パラメータの関数呼び出しモデルで、コンシューマデバイス上で6000トークン/秒のプリフィルと1200トークン/秒のデコードを実現します。単発のツール呼び出しにおいて、FunctionGemma-270M、Qwen-0.6B、Granite-350M、LFM2.5-350Mを上回ります。

ToolLoop:あらゆるモデルでClaudeスタイルのツールを実現するオープンソースエージェントフレームワーク
ToolLoopは、ファイル操作、コード検索、シェルアクセス、サブエージェント用の11のツールを備えたオープンソースのPythonフレームワークで、LiteLLMを通じて任意のLLMと連携します。2,700行のフレームワークにより、共有コンテキストを持ったまま会話中にモデルを切り替えることができます。

Claude Command Center: Claudeコード分析のためのオープンソースダッシュボード
Claude Command Centerは、~/.claude/ディレクトリを読み取り、Claude Codeのセッションデータ、コスト、MCPサーバー設定を表示するローカルダッシュボードです。ExpressバックエンドとReactフロントエンドをClaude Codeで完全に構築されており、設定不要でローカルで動作し、クラウドやテレメトリーは一切使用しません。

オープンソースダッシュボードが明らかにするClaudeコードの実際のコンピューティングコスト
ある開発者がClaude Codeのレート制限の計算式をリバースエンジニアリングし、リアルタイムの使用率パーセンテージ、実際のドルコスト、バーンレート、ピーク時間、およびどのスキル/フックが発動しているかを表示するローカルダッシュボードを構築しました。このツールにより、月額100ドルのプランが1か月で13,286ドル相当のAPIコンピュートを消費していたことが明らかになりました。