PhAIL Benchmark Évalue les Modèles VLA sur des Tâches Réelles de Robotique d'Entrepôt

PhAIL est un benchmark d'IA physique qui mesure la performance des modèles vision-langage-action (VLA) sur des tâches robotiques commerciales. Son créateur l'a développé car il ne trouvait pas de chiffres de performance honnêtes pour ces modèles dans des applications pratiques.
Détails du benchmark
Le benchmark teste quatre modèles VLA sur la préparation de commandes entre bacs, l'une des opérations d'entrepôt les plus courantes :
- OpenPI/pi0.5
- GR00T
- ACT
- SmolVLA
Tous les tests utilisent le même équipement : un robot Franka FR3 avec une pince Robotiq 2F-85 (configuration DROID), avec des objets identiques sur des centaines d'exécutions à l'aveugle où l'opérateur ne sait pas quel modèle fonctionne.
Résultats de performance
Le benchmark a révélé des écarts de performance significatifs :
- Performance du meilleur modèle : 64 unités par heure (UPH)
- Humain téléopérant le même robot : 330 UPH
- Humain effectuant la tâche manuellement : plus de 1 300 UPH
Données ouvertes et méthodologie
Tout du benchmark est disponible publiquement :
- Chaque exécution avec vidéo synchronisée et données de télémétrie
- Le jeu de données de fine-tuning utilisé pour l'entraînement
- Les scripts d'entraînement
- Un classement ouvert acceptant de nouvelles soumissions
Le créateur est disponible pour répondre aux questions sur la méthodologie, les modèles spécifiques testés ou les observations tirées des exécutions du benchmark.
📖 Read the full source: HN AI Agents
👀 See Also

Extension de navigateur WeAreHere et outils MCP analysent les pratiques de confidentialité des sites web
Deux outils open-source—barebrowse et wearehere—scannent les sites web pour détecter les traqueurs, l'empreinte numérique et les connexions aux courtiers de données. L'extension de navigateur wearehere affiche des scores de confidentialité en temps réel (0-100) pendant votre navigation, tandis que les serveurs MCP permettent aux assistants IA d'évaluer n'importe quel site sur commande.

Le goulot d'étranglement dans les agents IA parallèles : la file d'attente d'approbation humaine
Un développeur exécutant des agents Claude Code en parallèle décrit le « bottleself » — le point où le parallélisme cesse d'augmenter la production et commence à créer un backlog d'approbations humaines. Sa solution : un planificateur qui décompose les objectifs en sous-tâches, lance des agents, et n'interrompt que pour les décisions non résolues.

MemRosetta ajoute une mémoire persistante à Claude Code avec une configuration en une seule commande
MemRosetta v0.2.4 fournit à Claude Code une mémoire inter-sessions via une simple commande npm install. L'outil inclut un serveur MCP avec 6 outils de mémoire, une capture automatique des sessions et un stockage SQLite local qui peut être partagé avec Cursor.

mcp-optimizer réduit le gaspillage de jetons causé par les serveurs MCP inactifs dans Claude Code
mcp-optimizer est un plugin qui résout le gaspillage de jetons provenant des serveurs MCP dans Claude Code en analysant l'utilisation des outils et en générant des configurations optimisées. Il comprend quatre utilitaires : mcp-doctor pour les vérifications de santé des serveurs, mcp-audit pour l'analyse d'utilisation, mcp-optimize pour créer des configurations locales au projet, et mcp-to-skills pour convertir les outils en compétences à la demande.