PhAIL Benchmark Évalue les Modèles VLA sur des Tâches Réelles de Robotique d'Entrepôt

PhAIL est un benchmark d'IA physique qui mesure la performance des modèles vision-langage-action (VLA) sur des tâches robotiques commerciales. Son créateur l'a développé car il ne trouvait pas de chiffres de performance honnêtes pour ces modèles dans des applications pratiques.
Détails du benchmark
Le benchmark teste quatre modèles VLA sur la préparation de commandes entre bacs, l'une des opérations d'entrepôt les plus courantes :
- OpenPI/pi0.5
- GR00T
- ACT
- SmolVLA
Tous les tests utilisent le même équipement : un robot Franka FR3 avec une pince Robotiq 2F-85 (configuration DROID), avec des objets identiques sur des centaines d'exécutions à l'aveugle où l'opérateur ne sait pas quel modèle fonctionne.
Résultats de performance
Le benchmark a révélé des écarts de performance significatifs :
- Performance du meilleur modèle : 64 unités par heure (UPH)
- Humain téléopérant le même robot : 330 UPH
- Humain effectuant la tâche manuellement : plus de 1 300 UPH
Données ouvertes et méthodologie
Tout du benchmark est disponible publiquement :
- Chaque exécution avec vidéo synchronisée et données de télémétrie
- Le jeu de données de fine-tuning utilisé pour l'entraînement
- Les scripts d'entraînement
- Un classement ouvert acceptant de nouvelles soumissions
Le créateur est disponible pour répondre aux questions sur la méthodologie, les modèles spécifiques testés ou les observations tirées des exécutions du benchmark.
📖 Read the full source: HN AI Agents
👀 See Also

Claude Code Ajoute un Mode Automatique pour les Décisions d'Autorisation
Claude Code dispose désormais d'un mode automatique qui permet à Claude de prendre les décisions d'autorisation au lieu d'exiger une approbation manuelle pour chaque écriture de fichier et commande bash. Ce mode inclut des mesures de sécurité qui vérifient chaque action avant son exécution, avec un classificateur examinant les appels d'outils pour les actions potentiellement destructrices.

Tarification des Modèles OpenRouter et Analyse de l'Intelligence par Dollar
Un utilisateur de Reddit a compilé les tarifs de l'API OpenRouter pour 16 modèles d'IA et a calculé des valeurs d'intelligence par dollar, identifiant MiMo-V2-Flash comme le meilleur rapport qualité-prix à 0,09 $/M de tokens et GPT-5.4 comme le plus intelligent à 2,50 $/M de tokens.

Queuelo : Une API d'approbation légère pour les agents LLM
Queuelo est une couche API simple qui permet aux agents LLM de faire une pause avant des actions irréversibles. Les agents envoient des requêtes d'action via POST, vous êtes notifié pour approuver ou rejeter, et l'agent reçoit la réponse via webhook.

Analyse Codeflash : 118 bogues de performance détectés dans deux PR rédigés avec Claude Code
Codeflash a mesuré les performances de deux fonctionnalités majeures développées avec Claude Code et a constaté que 118 fonctions fonctionnaient jusqu'à 446 fois plus lentement que nécessaire. L'analyse a révélé des schémas d'algorithmes inefficaces, de calculs redondants, d'absence de mise en cache et de structures de données sous-optimales.