アンダースタディ:デモンストレーションでタスクを学習する教育可能なデスクトップエージェント

Understudyの機能
Understudyは、人間の同僚のようにコンピューターを操作する学習可能なデスクトップエージェントです。GUI、ブラウザ、シェル、ファイルシステム、メッセージングツールを1つのローカルランタイムで扱います。中核となる革新は「デモンストレーションによる学習」です。ユーザーがタスクを一度実行すると、エージェントは画面ビデオと意味的イベントを記録し、意図(単なる座標ではなく)を抽出し、再利用可能なスキルに変換します。
現在の実装状況
システムは5つのレイヤーで設計されており、現在の実装状況は以下の通りです:
- レイヤー1(ソフトウェアをネイティブに操作):現在macOSで実装済み。13のツール+スクリーンショットグラウンディング+ネイティブ入力を使用して、あらゆるmacOSデスクトップアプリを操作します。
- レイヤー2(デモンストレーションから学習):実装済みで現在使用可能。ユーザーがタスクを一度示すと、エージェントは意図を抽出し、検証し、学習します。
- レイヤー3(結晶化されたメモリ):部分的に実装済み。エージェントは日常使用から経験を蓄積し、成功したパスを強化します。
- レイヤー4(ルート最適化):部分的に実装済み。より高速な実行ルートを自動的に発見し、アップグレードします。
- レイヤー5(積極的自律性):長期的な方向性として検討中。ユーザーを妨げずに自らのワークスペースで気づき、行動します。
技術的能力
Understudyは、すべての実行ルートを1つのエージェントループ、1つのセッション、1つのポリシーパイプラインで統合するデスクトップランタイムです:
- GUI:13のツール+スクリーンショットグラウンディング+ネイティブ入力により、あらゆるmacOSデスクトップアプリを操作
- ブラウザ:Playwright管理+Chrome拡張機能リレーにより、ログインセッションを含むあらゆるウェブサイトを操作
- シェル:CLIツール、スクリプト、ファイルシステムに完全なローカルアクセスを提供するbashツール
- ウェブ:リアルタイム情報検索のためのweb_search+web_fetch
- メモリ:永続的なコンテキストと設定のためのセッション横断的な意味的メモリ
- メッセージング:8チャンネル対応
実際の動作
デモビデオでは、作成者がUnderstudyに次のことを教えています:Google画像検索→写真をダウンロード→Pixelmator Proで背景を削除→エクスポート→Telegramで送信。その後、同じことをイーロン・マスクに対して実行するよう指示します。再生は脆弱なマクロではありません。公開されたスキルは、意図のステップ、ルートオプション、およびフォールバックとしてのGUIヒントのみを保存します。利用可能な場合は、すべてのGUIステップを繰り返す代わりに、より高速なルートを優先できます。
インストールとセットアップ
現在のプラットフォーム:macOSのみ。インストールはnpm経由で行います:
npm install -g @understudy-ai/understudy
understudy wizard
ショーケースデモから公開されたスキルアーティファクトは、examples/published-skills/taught-person-photo-cutout-bc88ec/SKILL.mdで確認できます。
対象ユーザー
複数のデスクトップアプリケーションをまたいで作業し、カスタム統合やワークフロービルダーを構築せずに反復タスクを自動化したい開発者向けです。
📖 Read the full source: HN AI Agents
👀 See Also

コミットメント問題:未完了のGitHubリポジトリを分析して「埋葬」するツール
ある開発者が「Commitment Issues」というウェブツールを作成しました。このツールはGitHubリポジトリを分析して事実上放棄されたプロジェクトかどうかを判定し、ユーモラスな「埋葬」証明書を生成します。このツールは機械学習ではなくヒューリスティクスに基づいて構築されています。

タイトル:Agent Smith:Claude Code向けMCPサーバー、スキル、チケットからPRまでのパイプラインを構築する1つのコマンド
Agent Smithはリポジトリをスキャンし、使用されているスタック(Go/Echo、React/Zustand、golang-jwt、pgxなど)を正確に検出し、それに合わせたMCPサーバー、フック、スキルを設定し、自律的なチケットからPRへのパイプラインを提供します。

PhAILベンチマークは、実際の倉庫ロボットタスクでVLAモデルをテストします
PhAILは、Franka FR3ロボットを使用したビン間のオーダーピッキングにおいて、4つの視覚言語行動モデルをテストする実ロボットベンチマークです。最高のモデルは1時間あたり64ユニットを達成しましたが、人間による遠隔操作では330UPH、人間による手作業では1,300+ UPHでした。

Codiff v0.1.0: LLM生成コードレビュー用のローカル差分ビューア
Codiff v0.1.0は、ローカルのGit差分をレビューするための高速でミニマルなデスクトップアプリです。LLMウォークスルーモードと、Markdownとしてコピー可能なインラインコメントを備えています。