PhAIL Benchmark Testa Modelos VLA em Tarefas Reais de Robôs de Armazém

✍️ OpenClawRadar📅 Publicado: April 1, 2026🔗 Source
PhAIL Benchmark Testa Modelos VLA em Tarefas Reais de Robôs de Armazém
Ad

PhAIL é um benchmark de IA física que mede o desempenho de modelos visão-linguagem-ação (VLA) em tarefas de robótica comercial. O criador o desenvolveu porque não conseguia encontrar números honestos de desempenho para esses modelos em aplicações práticas.

Detalhes do Benchmark

O benchmark testa quatro modelos VLA na separação de pedidos de caixa para caixa, uma das operações mais comuns em armazéns:

  • OpenPI/pi0.5
  • GR00T
  • ACT
  • SmolVLA

Todos os testes usam o mesmo equipamento: um robô Franka FR3 com garra Robotiq 2F-85 (configuração DROID), com objetos idênticos em centenas de execuções cegas onde o operador não sabe qual modelo está rodando.

Ad

Resultados de Desempenho

O benchmark revelou lacunas significativas de desempenho:

  • Melhor desempenho do modelo: 64 unidades por hora (UPH)
  • Humano teleoperando o mesmo robô: 330 UPH
  • Humano executando a tarefa manualmente: mais de 1.300 UPH

Dados Abertos e Metodologia

Tudo do benchmark está disponível publicamente:

  • Cada execução com vídeo sincronizado e dados de telemetria
  • O conjunto de dados de fine-tuning usado para treinamento
  • Scripts de treinamento
  • Um ranking aberto que aceita novas submissões

O criador está disponível para responder perguntas sobre metodologia, os modelos específicos testados ou observações das execuções do benchmark.

📖 Read the full source: HN AI Agents

Ad

👀 See Also

Mascote Clawd Impresso em 3D com Mochi Bot Alimentado por ESP32
Tools

Mascote Clawd Impresso em 3D com Mochi Bot Alimentado por ESP32

Um desenvolvedor criou um Clawd 3D físico inspirado no mascote do Claude Code, com um bot Mochi baseado em ESP32 e uma pequena tela. Arquivos e código disponíveis no MakerWorld e no GitHub.

OpenClawRadar
LivingAgents.ai: Uma Simulação de Agentes de IA Baseada na Web Usando a API Claude
Tools

LivingAgents.ai: Uma Simulação de Agentes de IA Baseada na Web Usando a API Claude

LivingAgents.ai é uma simulação baseada na web onde cada agente é alimentado pela API Claude, realizando ações como forragear, negociar, criar, atacar, reproduzir e morrer permanentemente, com cada ação exigindo uma chamada real de LLM.

OpenClawRadar
Compactador de Garras: motor de compressão de tokens em 14 estágios para pipelines de LLM
Tools

Compactador de Garras: motor de compressão de tokens em 14 estágios para pipelines de LLM

Claw Compactor é um motor de compressão de tokens LLM de código aberto que utiliza um Pipeline de Fusão de 14 estágios para alcançar 54% de compressão média com custo zero de inferência LLM. Inclui compressores especializados para código, JSON, logs, diffs e resultados de busca com capacidades de compressão reversível.

OpenClawRadar
Atualizações do CodeLedger e Vibecop para Rastreamento de Custo e Qualidade de Codificação com IA Multi-Agente
Tools

Atualizações do CodeLedger e Vibecop para Rastreamento de Custo e Qualidade de Codificação com IA Multi-Agente

O CodeLedger agora monitora gastos no Claude Code, Codex CLI, Cline e Gemini CLI lendo arquivos de sessão locais, enquanto o Vibecop adiciona verificações automatizadas de qualidade com novos detectores específicos para LLMs e uma configuração de um comando para várias ferramentas de codificação com IA.

OpenClawRadar