PhAIL Benchmark Проверяет Модели VLA на Реальных Задачах Складских Роботов

✍️ OpenClawRadar📅 Опубликовано: 1 апреля 2026 г.🔗 Source
PhAIL Benchmark Проверяет Модели VLA на Реальных Задачах Складских Роботов
Ad

PhAIL — это физический ИИ-бенчмарк, который оценивает, насколько хорошо модели «зрение-язык-действие» (VLA) справляются с коммерческими задачами в робототехнике. Его создали потому, что не смогли найти честных данных о производительности таких моделей в практических применениях.

Детали бенчмарка

Бенчмарк тестирует четыре модели VLA на задаче подбора заказов из ящика в ящик — одной из самых распространённых операций на складе:

  • OpenPI/pi0.5
  • GR00T
  • ACT
  • SmolVLA

Все тесты используют одинаковое оборудование: робот Franka FR3 с захватом Robotiq 2F-85 (настройка DROID), с одними и теми же объектами в сотнях слепых прогонов, где оператор не знает, какая модель работает.

Ad

Результаты производительности

Бенчмарк выявил значительные разрывы в производительности:

  • Лучшая модель: 64 единицы в час (UPH)
  • Человек, телеуправляющий тем же роботом: 330 UPH
  • Человек, выполняющий задачу вручную: более 1300 UPH

Открытые данные и методология

Всё из бенчмарка находится в открытом доступе:

  • Каждый прогон с синхронизированными видео и телеметрическими данными
  • Набор данных для дообучения, использованный при тренировке
  • Скрипты для обучения
  • Открытая таблица лидеров, принимающая новые заявки

Создатель готов ответить на вопросы о методологии, конкретных протестированных моделях или наблюдениях из прогонов бенчмарка.

📖 Read the full source: HN AI Agents

Ad

👀 Смотрите также

Галерея архитектур LLM: Визуальный справочник по проектам моделей
Инструменты

Галерея архитектур LLM: Визуальный справочник по проектам моделей

Галерея архитектур LLM Себастьяна Рашки собирает схемы архитектур и технические характеристики из The Big LLM Architecture Comparison и A Dream of Spring for Open-Weight LLMs, с подробными спецификациями для моделей, таких как Llama 3 8B, DeepSeek V3 и Gemma 3 27B.

OpenClawRadar
Создание CLI для AI-агентов: принципы дизайна на примере Google's gws CLI
Инструменты

Создание CLI для AI-агентов: принципы дизайна на примере Google's gws CLI

Интерфейс командной строки gws от Google демонстрирует, как проектировать интерфейсы командной строки специально для ИИ-агентов, отдавая приоритет необработанным JSON-полезным нагрузкам вместо удобных для человека флагов и внедряя защитные механизмы против галлюцинаций.

OpenClawRadar
BottyFans: открытый API для монетизации ИИ-агентов через USDC
Инструменты

BottyFans: открытый API для монетизации ИИ-агентов через USDC

Новая платформа позволяет ИИ-агентам вести собственный креаторский бизнес с подписками, донатами и платным контентом в USDC.

OpenClaw Radar
Два новых инструмента с открытым исходным кодом для безопасности и оптимизации ИИ-агентов
Инструменты

Два новых инструмента с открытым исходным кодом для безопасности и оптимизации ИИ-агентов

Для разработчиков ИИ-агентов доступны два инструмента с открытым исходным кодом: AI Agent Defense Kit предоставляет навыки безопасности в режиме реального времени, а AgentGuard (в разработке) предлагает отслеживание затрат, сканирование безопасности и мониторинг активности.

OpenClawRadar