El Benchmark PhAIL Evalúa Modelos VLA en Tareas Reales de Robots de Almacén

✍️ OpenClawRadar📅 Publicado: 1 de abril de 2026🔗 Source
El Benchmark PhAIL Evalúa Modelos VLA en Tareas Reales de Robots de Almacén
Ad

PhAIL es un punto de referencia de IA física que mide qué tan bien los modelos de visión-lenguaje-acción (VLA) se desempeñan en tareas de robótica comercial. El creador lo desarrolló porque no pudo encontrar cifras de rendimiento honestas para estos modelos en aplicaciones prácticas.

Detalles del Punto de Referencia

El punto de referencia evalúa cuatro modelos VLA en la recolección de pedidos de contenedor a contenedor, una de las operaciones más comunes en almacenes:

  • OpenPI/pi0.5
  • GR00T
  • ACT
  • SmolVLA

Todas las pruebas utilizan el mismo equipo: un robot Franka FR3 con pinza Robotiq 2F-85 (configuración DROID), con objetos idénticos a lo largo de cientos de ejecuciones ciegas donde el operador no sabe qué modelo se está ejecutando.

Ad

Resultados de Rendimiento

El punto de referencia reveló brechas de rendimiento significativas:

  • Rendimiento del mejor modelo: 64 unidades por hora (UPH)
  • Humano teleoperando el mismo robot: 330 UPH
  • Humano realizando la tarea manualmente: más de 1,300 UPH

Datos Abiertos y Metodología

Todo del punto de referencia está disponible públicamente:

  • Cada ejecución con video sincronizado y datos de telemetría
  • El conjunto de datos de ajuste fino utilizado para el entrenamiento
  • Scripts de entrenamiento
  • Un ranking abierto que acepta nuevas presentaciones

El creador está disponible para responder preguntas sobre la metodología, los modelos específicos evaluados u observaciones de las ejecuciones del punto de referencia.

📖 Read the full source: HN AI Agents

Ad

👀 Ver también

Runtime: Agentes de Codificación en Entorno Aislado para Cada Miembro del Equipo
Herramientas

Runtime: Agentes de Codificación en Entorno Aislado para Cada Miembro del Equipo

Runtime (YC P26) proporciona infraestructura de agentes de codificación en sandbox que permite a los no ingenieros usar Claude Code, Codex y otros agentes de forma segura. Crea instantáneas de entornos multiservicio (Docker, Kafka, Redis, bases de datos sembradas) que arrancan en milisegundos, con protecciones a nivel de infraestructura.

OpenClawRadar
lazyclaude: Una Interfaz de Usuario de Texto (TUI) para Gestionar la Configuración de Código de Claude
Herramientas

lazyclaude: Una Interfaz de Usuario de Texto (TUI) para Gestionar la Configuración de Código de Claude

lazyclaude es una herramienta de interfaz de usuario de terminal inspirada en lazygit que proporciona una vista única para gestionar toda la configuración de Claude Code almacenada en disco, incluyendo archivos de memoria, habilidades, agentes, servidores MCP, configuraciones, permisos, hooks, atajos de teclado, sesiones, estadísticas, plugins y tareas pendientes.

OpenClawRadar
Asistente de Enseñanza de IA de UIUC Ejecuta 11 Modelos en Paralelo para Respuestas en Menos de 2 Segundos
Herramientas

Asistente de Enseñanza de IA de UIUC Ejecuta 11 Modelos en Paralelo para Respuestas en Menos de 2 Segundos

El chatbot AI TA de UIUC ejecuta 11 modelos en paralelo para recuperación y generación de texto e imágenes, moderación y clasificación, logrando un tiempo de respuesta medio de 2 segundos. Código abierto con RAG de Pinecone y conjunto de datos RLHF.

OpenClawRadar
Steerling-8B: Un modelo de lenguaje interpretable con atribución a nivel de token
Herramientas

Steerling-8B: Un modelo de lenguaje interpretable con atribución a nivel de token

Guide Labs lanzó Steerling-8B, un modelo de lenguaje de 8 mil millones de parámetros entrenado en 1.35 billones de tokens que puede rastrear cualquier token generado hasta el contexto de entrada, conceptos comprensibles para humanos y fuentes de datos de entrenamiento. El modelo logra un rendimiento competitivo con modelos entrenados con 2-7× más datos.

OpenClawRadar