PhAIL Benchmark Testa Modelos VLA em Tarefas Reais de Robôs de Armazém

PhAIL é um benchmark de IA física que mede o desempenho de modelos visão-linguagem-ação (VLA) em tarefas de robótica comercial. O criador o desenvolveu porque não conseguia encontrar números honestos de desempenho para esses modelos em aplicações práticas.
Detalhes do Benchmark
O benchmark testa quatro modelos VLA na separação de pedidos de caixa para caixa, uma das operações mais comuns em armazéns:
- OpenPI/pi0.5
- GR00T
- ACT
- SmolVLA
Todos os testes usam o mesmo equipamento: um robô Franka FR3 com garra Robotiq 2F-85 (configuração DROID), com objetos idênticos em centenas de execuções cegas onde o operador não sabe qual modelo está rodando.
Resultados de Desempenho
O benchmark revelou lacunas significativas de desempenho:
- Melhor desempenho do modelo: 64 unidades por hora (UPH)
- Humano teleoperando o mesmo robô: 330 UPH
- Humano executando a tarefa manualmente: mais de 1.300 UPH
Dados Abertos e Metodologia
Tudo do benchmark está disponível publicamente:
- Cada execução com vídeo sincronizado e dados de telemetria
- O conjunto de dados de fine-tuning usado para treinamento
- Scripts de treinamento
- Um ranking aberto que aceita novas submissões
O criador está disponível para responder perguntas sobre metodologia, os modelos específicos testados ou observações das execuções do benchmark.
📖 Read the full source: HN AI Agents
👀 See Also

Mascote Clawd Impresso em 3D com Mochi Bot Alimentado por ESP32
Um desenvolvedor criou um Clawd 3D físico inspirado no mascote do Claude Code, com um bot Mochi baseado em ESP32 e uma pequena tela. Arquivos e código disponíveis no MakerWorld e no GitHub.

LivingAgents.ai: Uma Simulação de Agentes de IA Baseada na Web Usando a API Claude
LivingAgents.ai é uma simulação baseada na web onde cada agente é alimentado pela API Claude, realizando ações como forragear, negociar, criar, atacar, reproduzir e morrer permanentemente, com cada ação exigindo uma chamada real de LLM.

Compactador de Garras: motor de compressão de tokens em 14 estágios para pipelines de LLM
Claw Compactor é um motor de compressão de tokens LLM de código aberto que utiliza um Pipeline de Fusão de 14 estágios para alcançar 54% de compressão média com custo zero de inferência LLM. Inclui compressores especializados para código, JSON, logs, diffs e resultados de busca com capacidades de compressão reversível.

Atualizações do CodeLedger e Vibecop para Rastreamento de Custo e Qualidade de Codificação com IA Multi-Agente
O CodeLedger agora monitora gastos no Claude Code, Codex CLI, Cline e Gemini CLI lendo arquivos de sessão locais, enquanto o Vibecop adiciona verificações automatizadas de qualidade com novos detectores específicos para LLMs e uma configuração de um comando para várias ferramentas de codificação com IA.