Doublure : Un Agent de Bureau Enseignable Qui Apprend les Tâches par Démonstration

✍️ OpenClawRadar📅 Publié: March 13, 2026🔗 Source
Doublure : Un Agent de Bureau Enseignable Qui Apprend les Tâches par Démonstration
Ad

Ce que fait Understudy

Understudy est un agent de bureau enseignable qui opère votre ordinateur comme un collègue humain — gérant l'interface graphique, le navigateur, le shell, le système de fichiers et les outils de messagerie dans un seul environnement d'exécution local. L'innovation principale est l'apprentissage par démonstration : vous effectuez une tâche une fois, l'agent enregistre une vidéo d'écran ainsi que des événements sémantiques, extrait l'intention (pas seulement les coordonnées), et la transforme en une compétence réutilisable.

État actuel de l'implémentation

Le système est conçu en cinq couches, avec l'état d'implémentation actuel :

  • Couche 1 (Opérer les logiciels nativement) : Implémentée aujourd'hui sur macOS. Opère toute application de bureau macOS en utilisant 13 outils + ancrage par capture d'écran + saisie native.
  • Couche 2 (Apprendre à partir de démonstrations) : Implémentée et utilisable aujourd'hui. L'utilisateur montre une tâche une fois — l'agent extrait l'intention, valide, apprend.
  • Couche 3 (Mémoire cristallisée) : Partiellement implémentée. L'agent accumule de l'expérience grâce à l'utilisation quotidienne, consolide les chemins réussis.
  • Couche 4 (Optimisation des itinéraires) : Partiellement implémentée. Découvre et améliore automatiquement vers des chemins d'exécution plus rapides.
  • Couche 5 (Autonomie proactive) : Toujours la direction à long terme. Remarquer et agir dans son propre espace de travail sans perturber l'utilisateur.
Ad

Capacités techniques

Understudy est un environnement d'exécution de bureau unifié qui mélange chaque chemin d'exécution dans une seule boucle d'agent, une seule session, un seul pipeline de politique :

  • Interface graphique : 13 outils + ancrage par capture d'écran + saisie native pour toute application de bureau macOS
  • Navigateur : Playwright géré + relais d'extension Chrome pour tout site web avec sessions de connexion
  • Shell : outil bash avec accès local complet pour les outils CLI, scripts, système de fichiers
  • Web : web_search + web_fetch pour la récupération d'informations en temps réel
  • Mémoire : Mémoire sémantique entre les sessions pour un contexte et des préférences persistants
  • Messagerie : Support de 8 canaux

Comment cela fonctionne en pratique

Dans la vidéo de démonstration, le créateur apprend à Understudy à : Rechercher une image sur Google → télécharger une photo → supprimer l'arrière-plan dans Pixelmator Pro → exporter → envoyer via Telegram. Puis lui demande de faire la même chose pour Elon Musk. La relecture n'est pas une macro fragile — la compétence publiée stocke les étapes d'intention, les options d'itinéraire, et les indices d'interface graphique uniquement comme solution de secours. Elle peut préférer des chemins plus rapides lorsqu'ils sont disponibles au lieu de répéter chaque étape d'interface graphique.

Installation et configuration

Plateforme actuelle : macOS uniquement. L'installation se fait via npm :

npm install -g @understudy-ai/understudy
understudy wizard

L'artefact de compétence publié de la démonstration de présentation est disponible à examples/published-skills/taught-person-photo-cutout-bc88ec/SKILL.md pour inspection.

À qui cela s'adresse

Développeurs qui travaillent sur plusieurs applications de bureau et souhaitent automatiser des tâches répétitives sans construire d'intégrations personnalisées ou de créateurs de flux de travail.

📖 Read the full source: HN AI Agents

Ad

👀 See Also

Fullerenes : Couche mémoire persistante open source pour agents de codage réduit les tokens de 64% sur SWE-bench
Tools

Fullerenes : Couche mémoire persistante open source pour agents de codage réduit les tokens de 64% sur SWE-bench

Fullerenes utilise un graphe de connaissances local SQLite construit via Tree-sitter pour donner aux agents de codage comme Claude Code une mémoire persistante, réduisant l'utilisation de tokens de 64 % sur SWE-bench et jusqu'à 96,6 % sur des benchmarks internes.

OpenClawRadar
uimax-mcp : Serveur MCP gratuit pour la revue et la correction automatisée du code frontend avec Claude Code
Tools

uimax-mcp : Serveur MCP gratuit pour la revue et la correction automatisée du code frontend avec Claude Code

uimax-mcp est un serveur MCP gratuit qui automatise la revue et la correction du code frontend en utilisant Claude Code. Avec une seule commande, il capture des captures d'écran, exécute des audits Lighthouse et d'accessibilité, recherche des anti-modèles et génère des corrections automatisées.

OpenClawRadar
iai-mcp : Un démon local offre à Claude une mémoire persistante entre sessions avec 99% de rappel
Tools

iai-mcp : Un démon local offre à Claude une mémoire persistante entre sessions avec 99% de rappel

iai-mcp est un démon local open-source qui capture chaque conversation Claude, l'organise en trois niveaux de mémoire et réinjecte le contexte dans les nouvelles sessions. Il atteint un rappel textuel de >99 %, une récupération en moins de 100 ms et un coût de démarrage de session inférieur à 3 000 tokens.

OpenClawRadar
Comparaison de 14 variantes d'agents d'IA Claw à travers 10 catégories
Tools

Comparaison de 14 variantes d'agents d'IA Claw à travers 10 catégories

Une comparaison détaillée de 14 variantes populaires d'agents Claw AI, incluant OpenClaw, NanoClaw, NemoClaw, ZeroClaw, PicoClaw, Moltis, IronClaw et NullClaw, évaluées sur 53 sous-paramètres avec des classements composites et des cas d'utilisation idéaux pour chacune.

OpenClawRadar