PhAIL Benchmark Évalue les Modèles VLA sur des Tâches Réelles de Robotique d'Entrepôt

PhAIL est un benchmark d'IA physique qui mesure la performance des modèles vision-langage-action (VLA) sur des tâches robotiques commerciales. Son créateur l'a développé car il ne trouvait pas de chiffres de performance honnêtes pour ces modèles dans des applications pratiques.
Détails du benchmark
Le benchmark teste quatre modèles VLA sur la préparation de commandes entre bacs, l'une des opérations d'entrepôt les plus courantes :
- OpenPI/pi0.5
- GR00T
- ACT
- SmolVLA
Tous les tests utilisent le même équipement : un robot Franka FR3 avec une pince Robotiq 2F-85 (configuration DROID), avec des objets identiques sur des centaines d'exécutions à l'aveugle où l'opérateur ne sait pas quel modèle fonctionne.
Résultats de performance
Le benchmark a révélé des écarts de performance significatifs :
- Performance du meilleur modèle : 64 unités par heure (UPH)
- Humain téléopérant le même robot : 330 UPH
- Humain effectuant la tâche manuellement : plus de 1 300 UPH
Données ouvertes et méthodologie
Tout du benchmark est disponible publiquement :
- Chaque exécution avec vidéo synchronisée et données de télémétrie
- Le jeu de données de fine-tuning utilisé pour l'entraînement
- Les scripts d'entraînement
- Un classement ouvert acceptant de nouvelles soumissions
Le créateur est disponible pour répondre aux questions sur la méthodologie, les modèles spécifiques testés ou les observations tirées des exécutions du benchmark.
📖 Read the full source: HN AI Agents
👀 See Also

Tandem MCP : exécuter et gérer des sessions Claude Code depuis le chat Claude.ai
Tandem est un serveur MCP open source qui relie le chat Claude.ai aux sessions locales de Claude Code, permettant des boucles de codage autonomes sans copier-coller.

Claude Code enregistre chaque session sur disque — voici comment les indexer et les retrouver
Claude Code écrit chaque tour de session dans ~/.claude/projects/ au format JSONL. Un utilisateur a indexé 1026 sessions (57 Mo, 76 000 tours) dans SQLite+FTS5 avec un serveur MCP pour la recherche et le rappel de fils de discussion à travers les sessions.

Le Mode Plan de Code Claude Réduit le Taux de Retravail de 40 % à Presque Zéro
Un développeur a suivi plus de 30 sessions de codage avec Claude Code et a constaté que sauter le Mode Planification entraînait la refonte des tâches depuis le début dans 40 % des cas. Avec le Mode Planification, le taux de refonte est tombé pratiquement à zéro, avec une fonctionnalité prenant 17 minutes au total contre 35+ minutes sans planification.

TeenyApp permet à Claude de créer et déployer des sites web full-stack à partir d'un simple lien de chat
TeenyApp fournit un sous-domaine en direct et un jeton d'agent que Claude peut utiliser via HTTP pour structurer le code, exécuter des migrations, configurer l'authentification et déployer directement vers une URL réelle sans quitter le chat.