El Benchmark PhAIL Evalúa Modelos VLA en Tareas Reales de Robots de Almacén

PhAIL es un punto de referencia de IA física que mide qué tan bien los modelos de visión-lenguaje-acción (VLA) se desempeñan en tareas de robótica comercial. El creador lo desarrolló porque no pudo encontrar cifras de rendimiento honestas para estos modelos en aplicaciones prácticas.
Detalles del Punto de Referencia
El punto de referencia evalúa cuatro modelos VLA en la recolección de pedidos de contenedor a contenedor, una de las operaciones más comunes en almacenes:
- OpenPI/pi0.5
- GR00T
- ACT
- SmolVLA
Todas las pruebas utilizan el mismo equipo: un robot Franka FR3 con pinza Robotiq 2F-85 (configuración DROID), con objetos idénticos a lo largo de cientos de ejecuciones ciegas donde el operador no sabe qué modelo se está ejecutando.
Resultados de Rendimiento
El punto de referencia reveló brechas de rendimiento significativas:
- Rendimiento del mejor modelo: 64 unidades por hora (UPH)
- Humano teleoperando el mismo robot: 330 UPH
- Humano realizando la tarea manualmente: más de 1,300 UPH
Datos Abiertos y Metodología
Todo del punto de referencia está disponible públicamente:
- Cada ejecución con video sincronizado y datos de telemetría
- El conjunto de datos de ajuste fino utilizado para el entrenamiento
- Scripts de entrenamiento
- Un ranking abierto que acepta nuevas presentaciones
El creador está disponible para responder preguntas sobre la metodología, los modelos específicos evaluados u observaciones de las ejecuciones del punto de referencia.
📖 Read the full source: HN AI Agents
👀 Ver también

Runtime: Agentes de Codificación en Entorno Aislado para Cada Miembro del Equipo
Runtime (YC P26) proporciona infraestructura de agentes de codificación en sandbox que permite a los no ingenieros usar Claude Code, Codex y otros agentes de forma segura. Crea instantáneas de entornos multiservicio (Docker, Kafka, Redis, bases de datos sembradas) que arrancan en milisegundos, con protecciones a nivel de infraestructura.

lazyclaude: Una Interfaz de Usuario de Texto (TUI) para Gestionar la Configuración de Código de Claude
lazyclaude es una herramienta de interfaz de usuario de terminal inspirada en lazygit que proporciona una vista única para gestionar toda la configuración de Claude Code almacenada en disco, incluyendo archivos de memoria, habilidades, agentes, servidores MCP, configuraciones, permisos, hooks, atajos de teclado, sesiones, estadísticas, plugins y tareas pendientes.

Asistente de Enseñanza de IA de UIUC Ejecuta 11 Modelos en Paralelo para Respuestas en Menos de 2 Segundos
El chatbot AI TA de UIUC ejecuta 11 modelos en paralelo para recuperación y generación de texto e imágenes, moderación y clasificación, logrando un tiempo de respuesta medio de 2 segundos. Código abierto con RAG de Pinecone y conjunto de datos RLHF.

Steerling-8B: Un modelo de lenguaje interpretable con atribución a nivel de token
Guide Labs lanzó Steerling-8B, un modelo de lenguaje de 8 mil millones de parámetros entrenado en 1.35 billones de tokens que puede rastrear cualquier token generado hasta el contexto de entrada, conceptos comprensibles para humanos y fuentes de datos de entrenamiento. El modelo logra un rendimiento competitivo con modelos entrenados con 2-7× más datos.