Doublure : Un Agent de Bureau Enseignable Qui Apprend les Tâches par Démonstration

✍️ OpenClawRadar📅 Publié: March 13, 2026🔗 Source
Doublure : Un Agent de Bureau Enseignable Qui Apprend les Tâches par Démonstration
Ad

Ce que fait Understudy

Understudy est un agent de bureau enseignable qui opère votre ordinateur comme un collègue humain — gérant l'interface graphique, le navigateur, le shell, le système de fichiers et les outils de messagerie dans un seul environnement d'exécution local. L'innovation principale est l'apprentissage par démonstration : vous effectuez une tâche une fois, l'agent enregistre une vidéo d'écran ainsi que des événements sémantiques, extrait l'intention (pas seulement les coordonnées), et la transforme en une compétence réutilisable.

État actuel de l'implémentation

Le système est conçu en cinq couches, avec l'état d'implémentation actuel :

  • Couche 1 (Opérer les logiciels nativement) : Implémentée aujourd'hui sur macOS. Opère toute application de bureau macOS en utilisant 13 outils + ancrage par capture d'écran + saisie native.
  • Couche 2 (Apprendre à partir de démonstrations) : Implémentée et utilisable aujourd'hui. L'utilisateur montre une tâche une fois — l'agent extrait l'intention, valide, apprend.
  • Couche 3 (Mémoire cristallisée) : Partiellement implémentée. L'agent accumule de l'expérience grâce à l'utilisation quotidienne, consolide les chemins réussis.
  • Couche 4 (Optimisation des itinéraires) : Partiellement implémentée. Découvre et améliore automatiquement vers des chemins d'exécution plus rapides.
  • Couche 5 (Autonomie proactive) : Toujours la direction à long terme. Remarquer et agir dans son propre espace de travail sans perturber l'utilisateur.
Ad

Capacités techniques

Understudy est un environnement d'exécution de bureau unifié qui mélange chaque chemin d'exécution dans une seule boucle d'agent, une seule session, un seul pipeline de politique :

  • Interface graphique : 13 outils + ancrage par capture d'écran + saisie native pour toute application de bureau macOS
  • Navigateur : Playwright géré + relais d'extension Chrome pour tout site web avec sessions de connexion
  • Shell : outil bash avec accès local complet pour les outils CLI, scripts, système de fichiers
  • Web : web_search + web_fetch pour la récupération d'informations en temps réel
  • Mémoire : Mémoire sémantique entre les sessions pour un contexte et des préférences persistants
  • Messagerie : Support de 8 canaux

Comment cela fonctionne en pratique

Dans la vidéo de démonstration, le créateur apprend à Understudy à : Rechercher une image sur Google → télécharger une photo → supprimer l'arrière-plan dans Pixelmator Pro → exporter → envoyer via Telegram. Puis lui demande de faire la même chose pour Elon Musk. La relecture n'est pas une macro fragile — la compétence publiée stocke les étapes d'intention, les options d'itinéraire, et les indices d'interface graphique uniquement comme solution de secours. Elle peut préférer des chemins plus rapides lorsqu'ils sont disponibles au lieu de répéter chaque étape d'interface graphique.

Installation et configuration

Plateforme actuelle : macOS uniquement. L'installation se fait via npm :

npm install -g @understudy-ai/understudy
understudy wizard

L'artefact de compétence publié de la démonstration de présentation est disponible à examples/published-skills/taught-person-photo-cutout-bc88ec/SKILL.md pour inspection.

À qui cela s'adresse

Développeurs qui travaillent sur plusieurs applications de bureau et souhaitent automatiser des tâches répétitives sans construire d'intégrations personnalisées ou de créateurs de flux de travail.

📖 Read the full source: HN AI Agents

Ad

👀 See Also

Dirac : un agent open-source domine TerminalBench avec 65,2 %, moins cher et ouvert
Tools

Dirac : un agent open-source domine TerminalBench avec 65,2 %, moins cher et ouvert

Dirac, un agent de codage open-source, a obtenu un score de 65,2 % sur TerminalBench 2.0 pour gemini-3-flash-preview, surpassant le socle de Google (47,6 %) et le meilleur agent propriétaire Junie CLI (64,3 %). Il réduit également les coûts API de 64,8 % par rapport à ses concurrents.

OpenClawRadar
PACT : Un Cadre de Gouvernance Programmatique pour le Code Claude Après les Modèles de Défaillance des Agents
Tools

PACT : Un Cadre de Gouvernance Programmatique pour le Code Claude Après les Modèles de Défaillance des Agents

Un développeur a créé PACT (Programmatic Agent Constraint Toolkit) après trois mois d'échecs récurrents de Claude Code sur une application mobile de plus de 350 fichiers. Le framework remplace des règles inapplicables par des contraintes mécaniques qui bloquent physiquement les violations via des hooks avant l'utilisation des outils.

OpenClawRadar
🦀
Tools

DashClaw : une couche d'approbation pour les agents OpenClaw

DashClaw est une couche d'approbation open source qui intercepte les appels d'outils destructeurs dans OpenClaw, Claude Code et d'autres agents, nécessitant une approbation humaine via Telegram avant l'exécution.

OpenClawRadar
Comparaison des systèmes d'IA multi-agents : Le modèle Harness d'Anthropic contre le modèle Engineering Org d'Agyn
Tools

Comparaison des systèmes d'IA multi-agents : Le modèle Harness d'Anthropic contre le modèle Engineering Org d'Agyn

Anthropic a publié une conception de harnais pour le développement d'applications de longue durée, tandis que le système multi-agents d'Agyn pour l'ingénierie logicielle autonome en équipe a été rendu open-source le mois dernier. Les deux systèmes rejettent les agents monolithiques au profit de la séparation des rôles, des transferts structurés et des boucles de révision.

OpenClawRadar