PhAIL Benchmark Évalue les Modèles VLA sur des Tâches Réelles de Robotique d'Entrepôt

✍️ OpenClawRadar📅 Publié: April 1, 2026🔗 Source
PhAIL Benchmark Évalue les Modèles VLA sur des Tâches Réelles de Robotique d'Entrepôt
Ad

PhAIL est un benchmark d'IA physique qui mesure la performance des modèles vision-langage-action (VLA) sur des tâches robotiques commerciales. Son créateur l'a développé car il ne trouvait pas de chiffres de performance honnêtes pour ces modèles dans des applications pratiques.

Détails du benchmark

Le benchmark teste quatre modèles VLA sur la préparation de commandes entre bacs, l'une des opérations d'entrepôt les plus courantes :

  • OpenPI/pi0.5
  • GR00T
  • ACT
  • SmolVLA

Tous les tests utilisent le même équipement : un robot Franka FR3 avec une pince Robotiq 2F-85 (configuration DROID), avec des objets identiques sur des centaines d'exécutions à l'aveugle où l'opérateur ne sait pas quel modèle fonctionne.

Ad

Résultats de performance

Le benchmark a révélé des écarts de performance significatifs :

  • Performance du meilleur modèle : 64 unités par heure (UPH)
  • Humain téléopérant le même robot : 330 UPH
  • Humain effectuant la tâche manuellement : plus de 1 300 UPH

Données ouvertes et méthodologie

Tout du benchmark est disponible publiquement :

  • Chaque exécution avec vidéo synchronisée et données de télémétrie
  • Le jeu de données de fine-tuning utilisé pour l'entraînement
  • Les scripts d'entraînement
  • Un classement ouvert acceptant de nouvelles soumissions

Le créateur est disponible pour répondre aux questions sur la méthodologie, les modèles spécifiques testés ou les observations tirées des exécutions du benchmark.

📖 Read the full source: HN AI Agents

Ad

👀 See Also

Claude Code Ajoute un Mode Automatique pour les Décisions d'Autorisation
Tools

Claude Code Ajoute un Mode Automatique pour les Décisions d'Autorisation

Claude Code dispose désormais d'un mode automatique qui permet à Claude de prendre les décisions d'autorisation au lieu d'exiger une approbation manuelle pour chaque écriture de fichier et commande bash. Ce mode inclut des mesures de sécurité qui vérifient chaque action avant son exécution, avec un classificateur examinant les appels d'outils pour les actions potentiellement destructrices.

OpenClawRadar
Tarification des Modèles OpenRouter et Analyse de l'Intelligence par Dollar
Tools

Tarification des Modèles OpenRouter et Analyse de l'Intelligence par Dollar

Un utilisateur de Reddit a compilé les tarifs de l'API OpenRouter pour 16 modèles d'IA et a calculé des valeurs d'intelligence par dollar, identifiant MiMo-V2-Flash comme le meilleur rapport qualité-prix à 0,09 $/M de tokens et GPT-5.4 comme le plus intelligent à 2,50 $/M de tokens.

OpenClawRadar
Queuelo : Une API d'approbation légère pour les agents LLM
Tools

Queuelo : Une API d'approbation légère pour les agents LLM

Queuelo est une couche API simple qui permet aux agents LLM de faire une pause avant des actions irréversibles. Les agents envoient des requêtes d'action via POST, vous êtes notifié pour approuver ou rejeter, et l'agent reçoit la réponse via webhook.

OpenClawRadar
Analyse Codeflash : 118 bogues de performance détectés dans deux PR rédigés avec Claude Code
Tools

Analyse Codeflash : 118 bogues de performance détectés dans deux PR rédigés avec Claude Code

Codeflash a mesuré les performances de deux fonctionnalités majeures développées avec Claude Code et a constaté que 118 fonctions fonctionnaient jusqu'à 446 fois plus lentement que nécessaire. L'analyse a révélé des schémas d'algorithmes inefficaces, de calculs redondants, d'absence de mise en cache et de structures de données sous-optimales.

OpenClawRadar