PhAIL Benchmark Проверяет Модели VLA на Реальных Задачах Складских Роботов

PhAIL — это физический ИИ-бенчмарк, который оценивает, насколько хорошо модели «зрение-язык-действие» (VLA) справляются с коммерческими задачами в робототехнике. Его создали потому, что не смогли найти честных данных о производительности таких моделей в практических применениях.
Детали бенчмарка
Бенчмарк тестирует четыре модели VLA на задаче подбора заказов из ящика в ящик — одной из самых распространённых операций на складе:
- OpenPI/pi0.5
- GR00T
- ACT
- SmolVLA
Все тесты используют одинаковое оборудование: робот Franka FR3 с захватом Robotiq 2F-85 (настройка DROID), с одними и теми же объектами в сотнях слепых прогонов, где оператор не знает, какая модель работает.
Результаты производительности
Бенчмарк выявил значительные разрывы в производительности:
- Лучшая модель: 64 единицы в час (UPH)
- Человек, телеуправляющий тем же роботом: 330 UPH
- Человек, выполняющий задачу вручную: более 1300 UPH
Открытые данные и методология
Всё из бенчмарка находится в открытом доступе:
- Каждый прогон с синхронизированными видео и телеметрическими данными
- Набор данных для дообучения, использованный при тренировке
- Скрипты для обучения
- Открытая таблица лидеров, принимающая новые заявки
Создатель готов ответить на вопросы о методологии, конкретных протестированных моделях или наблюдениях из прогонов бенчмарка.
📖 Read the full source: HN AI Agents
👀 Смотрите также

Галерея архитектур LLM: Визуальный справочник по проектам моделей
Галерея архитектур LLM Себастьяна Рашки собирает схемы архитектур и технические характеристики из The Big LLM Architecture Comparison и A Dream of Spring for Open-Weight LLMs, с подробными спецификациями для моделей, таких как Llama 3 8B, DeepSeek V3 и Gemma 3 27B.

Создание CLI для AI-агентов: принципы дизайна на примере Google's gws CLI
Интерфейс командной строки gws от Google демонстрирует, как проектировать интерфейсы командной строки специально для ИИ-агентов, отдавая приоритет необработанным JSON-полезным нагрузкам вместо удобных для человека флагов и внедряя защитные механизмы против галлюцинаций.

BottyFans: открытый API для монетизации ИИ-агентов через USDC
Новая платформа позволяет ИИ-агентам вести собственный креаторский бизнес с подписками, донатами и платным контентом в USDC.

Два новых инструмента с открытым исходным кодом для безопасности и оптимизации ИИ-агентов
Для разработчиков ИИ-агентов доступны два инструмента с открытым исходным кодом: AI Agent Defense Kit предоставляет навыки безопасности в режиме реального времени, а AgentGuard (в разработке) предлагает отслеживание затрат, сканирование безопасности и мониторинг активности.