PhAIL Benchmark Testa Modelos VLA em Tarefas Reais de Robôs de Armazém

✍️ OpenClawRadar📅 Publicado: April 1, 2026🔗 Source
PhAIL Benchmark Testa Modelos VLA em Tarefas Reais de Robôs de Armazém
Ad

PhAIL é um benchmark de IA física que mede o desempenho de modelos visão-linguagem-ação (VLA) em tarefas de robótica comercial. O criador o desenvolveu porque não conseguia encontrar números honestos de desempenho para esses modelos em aplicações práticas.

Detalhes do Benchmark

O benchmark testa quatro modelos VLA na separação de pedidos de caixa para caixa, uma das operações mais comuns em armazéns:

  • OpenPI/pi0.5
  • GR00T
  • ACT
  • SmolVLA

Todos os testes usam o mesmo equipamento: um robô Franka FR3 com garra Robotiq 2F-85 (configuração DROID), com objetos idênticos em centenas de execuções cegas onde o operador não sabe qual modelo está rodando.

Ad

Resultados de Desempenho

O benchmark revelou lacunas significativas de desempenho:

  • Melhor desempenho do modelo: 64 unidades por hora (UPH)
  • Humano teleoperando o mesmo robô: 330 UPH
  • Humano executando a tarefa manualmente: mais de 1.300 UPH

Dados Abertos e Metodologia

Tudo do benchmark está disponível publicamente:

  • Cada execução com vídeo sincronizado e dados de telemetria
  • O conjunto de dados de fine-tuning usado para treinamento
  • Scripts de treinamento
  • Um ranking aberto que aceita novas submissões

O criador está disponível para responder perguntas sobre metodologia, os modelos específicos testados ou observações das execuções do benchmark.

📖 Read the full source: HN AI Agents

Ad

👀 See Also

ddash: Ferramenta de Diagrama Mermaid com Armazenamento Baseado em URL e Integração de Código Claude
Tools

ddash: Ferramenta de Diagrama Mermaid com Armazenamento Baseado em URL e Integração de Código Claude

ddash é uma ferramenta gratuita de diagramas Mermaid onde todo o diagrama é comprimido no hash da URL, não exigindo backend, contas ou armazenamento. Inclui uma habilidade Claude Code que permite gerar e abrir diagramas diretamente durante conversas com comandos como /diagram the auth flow.

OpenClawRadar
Flue: Um Framework TypeScript para Construção de Agentes de Codificação Autônomos
Tools

Flue: Um Framework TypeScript para Construção de Agentes de Codificação Autônomos

Flue é um framework TypeScript que fornece uma estrutura programável para construir agentes autônomos, com recursos como habilidades, sessões, execução de shell em ambiente isolado e uma sandbox virtual integrada. Ele pode substituir ferramentas como Dosu, Greptile, CodeRabbit, Devin e Claude Code com lógica de agente personalizada.

OpenClawRadar
MoltPoker.xyz: Texas Hold'em com Fichas Virtuais para Agentes de IA
Tools

MoltPoker.xyz: Texas Hold'em com Fichas Virtuais para Agentes de IA

MoltPoker.xyz é uma plataforma onde agentes de IA podem jogar Texas Hold'em No-Limit uns contra os outros usando conexões WebSocket, com mãos reproduzíveis e raciocínio dos agentes visível durante os jogos ao vivo.

OpenClawRadar
Fábrica de Agentes: Sistema Autônomo Constrói Agentes de IA a Partir de Discussões de Problemas Online
Tools

Fábrica de Agentes: Sistema Autônomo Constrói Agentes de IA a Partir de Discussões de Problemas Online

A Fábrica de Agentes é um sistema autônomo que coleta dados do Reddit, HN, GitHub e Twitter em busca de problemas reais, pontua-os com base na demanda, lacuna de mercado e viabilidade, e então constrói agentes de IA independentes para ideias promissoras. O sistema utiliza um modelo mínimo do Next.js com 7 ferramentas e executa o Claude Code em modo headless por meio de um script shell.

OpenClawRadar