PhAIL Benchmark Évalue les Modèles VLA sur des Tâches Réelles de Robotique d'Entrepôt

✍️ OpenClawRadar📅 Publié: April 1, 2026🔗 Source
PhAIL Benchmark Évalue les Modèles VLA sur des Tâches Réelles de Robotique d'Entrepôt
Ad

PhAIL est un benchmark d'IA physique qui mesure la performance des modèles vision-langage-action (VLA) sur des tâches robotiques commerciales. Son créateur l'a développé car il ne trouvait pas de chiffres de performance honnêtes pour ces modèles dans des applications pratiques.

Détails du benchmark

Le benchmark teste quatre modèles VLA sur la préparation de commandes entre bacs, l'une des opérations d'entrepôt les plus courantes :

  • OpenPI/pi0.5
  • GR00T
  • ACT
  • SmolVLA

Tous les tests utilisent le même équipement : un robot Franka FR3 avec une pince Robotiq 2F-85 (configuration DROID), avec des objets identiques sur des centaines d'exécutions à l'aveugle où l'opérateur ne sait pas quel modèle fonctionne.

Ad

Résultats de performance

Le benchmark a révélé des écarts de performance significatifs :

  • Performance du meilleur modèle : 64 unités par heure (UPH)
  • Humain téléopérant le même robot : 330 UPH
  • Humain effectuant la tâche manuellement : plus de 1 300 UPH

Données ouvertes et méthodologie

Tout du benchmark est disponible publiquement :

  • Chaque exécution avec vidéo synchronisée et données de télémétrie
  • Le jeu de données de fine-tuning utilisé pour l'entraînement
  • Les scripts d'entraînement
  • Un classement ouvert acceptant de nouvelles soumissions

Le créateur est disponible pour répondre aux questions sur la méthodologie, les modèles spécifiques testés ou les observations tirées des exécutions du benchmark.

📖 Read the full source: HN AI Agents

Ad

👀 See Also

Extension de navigateur WeAreHere et outils MCP analysent les pratiques de confidentialité des sites web
Tools

Extension de navigateur WeAreHere et outils MCP analysent les pratiques de confidentialité des sites web

Deux outils open-source—barebrowse et wearehere—scannent les sites web pour détecter les traqueurs, l'empreinte numérique et les connexions aux courtiers de données. L'extension de navigateur wearehere affiche des scores de confidentialité en temps réel (0-100) pendant votre navigation, tandis que les serveurs MCP permettent aux assistants IA d'évaluer n'importe quel site sur commande.

OpenClawRadar
Le goulot d'étranglement dans les agents IA parallèles : la file d'attente d'approbation humaine
Tools

Le goulot d'étranglement dans les agents IA parallèles : la file d'attente d'approbation humaine

Un développeur exécutant des agents Claude Code en parallèle décrit le « bottleself » — le point où le parallélisme cesse d'augmenter la production et commence à créer un backlog d'approbations humaines. Sa solution : un planificateur qui décompose les objectifs en sous-tâches, lance des agents, et n'interrompt que pour les décisions non résolues.

OpenClawRadar
MemRosetta ajoute une mémoire persistante à Claude Code avec une configuration en une seule commande
Tools

MemRosetta ajoute une mémoire persistante à Claude Code avec une configuration en une seule commande

MemRosetta v0.2.4 fournit à Claude Code une mémoire inter-sessions via une simple commande npm install. L'outil inclut un serveur MCP avec 6 outils de mémoire, une capture automatique des sessions et un stockage SQLite local qui peut être partagé avec Cursor.

OpenClawRadar
mcp-optimizer réduit le gaspillage de jetons causé par les serveurs MCP inactifs dans Claude Code
Tools

mcp-optimizer réduit le gaspillage de jetons causé par les serveurs MCP inactifs dans Claude Code

mcp-optimizer est un plugin qui résout le gaspillage de jetons provenant des serveurs MCP dans Claude Code en analysant l'utilisation des outils et en générant des configurations optimisées. Il comprend quatre utilitaires : mcp-doctor pour les vérifications de santé des serveurs, mcp-audit pour l'analyse d'utilisation, mcp-optimize pour créer des configurations locales au projet, et mcp-to-skills pour convertir les outils en compétences à la demande.

OpenClawRadar