PhAIL Benchmark Évalue les Modèles VLA sur des Tâches Réelles de Robotique d'Entrepôt

✍️ OpenClawRadar📅 Publié: April 1, 2026🔗 Source
PhAIL Benchmark Évalue les Modèles VLA sur des Tâches Réelles de Robotique d'Entrepôt
Ad

PhAIL est un benchmark d'IA physique qui mesure la performance des modèles vision-langage-action (VLA) sur des tâches robotiques commerciales. Son créateur l'a développé car il ne trouvait pas de chiffres de performance honnêtes pour ces modèles dans des applications pratiques.

Détails du benchmark

Le benchmark teste quatre modèles VLA sur la préparation de commandes entre bacs, l'une des opérations d'entrepôt les plus courantes :

  • OpenPI/pi0.5
  • GR00T
  • ACT
  • SmolVLA

Tous les tests utilisent le même équipement : un robot Franka FR3 avec une pince Robotiq 2F-85 (configuration DROID), avec des objets identiques sur des centaines d'exécutions à l'aveugle où l'opérateur ne sait pas quel modèle fonctionne.

Ad

Résultats de performance

Le benchmark a révélé des écarts de performance significatifs :

  • Performance du meilleur modèle : 64 unités par heure (UPH)
  • Humain téléopérant le même robot : 330 UPH
  • Humain effectuant la tâche manuellement : plus de 1 300 UPH

Données ouvertes et méthodologie

Tout du benchmark est disponible publiquement :

  • Chaque exécution avec vidéo synchronisée et données de télémétrie
  • Le jeu de données de fine-tuning utilisé pour l'entraînement
  • Les scripts d'entraînement
  • Un classement ouvert acceptant de nouvelles soumissions

Le créateur est disponible pour répondre aux questions sur la méthodologie, les modèles spécifiques testés ou les observations tirées des exécutions du benchmark.

📖 Read the full source: HN AI Agents

Ad

👀 See Also

Tandem MCP : exécuter et gérer des sessions Claude Code depuis le chat Claude.ai
Tools

Tandem MCP : exécuter et gérer des sessions Claude Code depuis le chat Claude.ai

Tandem est un serveur MCP open source qui relie le chat Claude.ai aux sessions locales de Claude Code, permettant des boucles de codage autonomes sans copier-coller.

OpenClawRadar
Claude Code enregistre chaque session sur disque — voici comment les indexer et les retrouver
Tools

Claude Code enregistre chaque session sur disque — voici comment les indexer et les retrouver

Claude Code écrit chaque tour de session dans ~/.claude/projects/ au format JSONL. Un utilisateur a indexé 1026 sessions (57 Mo, 76 000 tours) dans SQLite+FTS5 avec un serveur MCP pour la recherche et le rappel de fils de discussion à travers les sessions.

OpenClawRadar
Le Mode Plan de Code Claude Réduit le Taux de Retravail de 40 % à Presque Zéro
Tools

Le Mode Plan de Code Claude Réduit le Taux de Retravail de 40 % à Presque Zéro

Un développeur a suivi plus de 30 sessions de codage avec Claude Code et a constaté que sauter le Mode Planification entraînait la refonte des tâches depuis le début dans 40 % des cas. Avec le Mode Planification, le taux de refonte est tombé pratiquement à zéro, avec une fonctionnalité prenant 17 minutes au total contre 35+ minutes sans planification.

OpenClawRadar
TeenyApp permet à Claude de créer et déployer des sites web full-stack à partir d'un simple lien de chat
Tools

TeenyApp permet à Claude de créer et déployer des sites web full-stack à partir d'un simple lien de chat

TeenyApp fournit un sous-domaine en direct et un jeton d'agent que Claude peut utiliser via HTTP pour structurer le code, exécuter des migrations, configurer l'authentification et déployer directement vers une URL réelle sans quitter le chat.

OpenClawRadar