PhAIL 벤치마크, 실제 창고 로봇 작업에서 VLA 모델 성능 평가

PhAIL은 비전-언어-액션(VLA) 모델이 상업용 로봇 공학 작업에서 얼마나 잘 수행하는지 측정하는 물리적 AI 벤치마크입니다. 제작자는 이러한 모델들의 실제 응용 분야에서 정직한 성능 수치를 찾을 수 없어 이를 구축했습니다.
벤치마크 세부사항
이 벤치마크는 가장 일반적인 창고 작업 중 하나인 빈-투-빈 주문 피킹 작업에서 4가지 VLA 모델을 테스트합니다:
- OpenPI/pi0.5
- GR00T
- ACT
- SmolVLA
모든 테스트는 동일한 장비를 사용합니다: Robotiq 2F-85 그리퍼(DROID 설정)가 장착된 Franka FR3 로봇으로, 운영자가 어떤 모델이 실행 중인지 모르는 수백 번의 블라인드 실행에서 동일한 객체를 사용합니다.
성능 결과
벤치마크는 상당한 성능 격차를 드러냈습니다:
- 최고 모델 성능: 시간당 64개 단위(UPH)
- 동일한 로봇을 인간이 원격 조작: 330 UPH
- 인간이 수동으로 작업 수행: 1,300+ UPH
공개 데이터 및 방법론
벤치마크의 모든 것이 공개적으로 이용 가능합니다:
- 동기화된 비디오 및 원격 측정 데이터가 포함된 모든 실행
- 훈련에 사용된 미세 조정 데이터셋
- 훈련 스크립트
- 새로운 제출을 받아들이는 공개 리더보드
제작자는 방법론, 테스트된 특정 모델, 또는 벤치마크 실행 관찰에 관한 질문에 답변할 수 있습니다.
📖 Read the full source: HN AI Agents
👀 See Also

클로드 코드용 맞춤 출력 스타일 컬렉션
한 개발자가 클로드 코드를 위한 13가지 맞춤형 출력 스타일을 만들어 AI의 동작을 시스템 프롬프트를 통해 수정했습니다. 이 스타일에는 잔인한 코드 비판을 위한 '로스트', 안내형 질문을 위한 '소크라테스', 적대적 테스트를 위한 '브레이커', 실용적 해결책을 위한 '십 잇', 보안 중심을 위한 '파라노이드', 테스트 주도 개발을 위한 'TDD' 등이 포함됩니다.

OpenClaw의 보안, 비용, 복잡성 문제를 해결하는 여섯 가지 오픈소스 도구
한 개발자가 Cisco가 지적한 OpenClaw의 보안 취약점, 급증하는 비용, 복잡한 설정을 해결하기 위해 6가지 커뮤니티 도구를 테스트했습니다. ClawSec는 보안 스캔과 무결성 검증을 제공하고, Antfarm은 결정론적 멀티 에이전트 워크플로우를 가능하게 하며, LanceDB Pro는 하이브리드 벡터 검색으로 메모리 검색을 개선합니다.

무료 모델 알림: Tencent Hy3, OpenRouter에서 2주간 제공 — 지금 사용해보세요
Tencent Hy3가 OpenRouter에서 2주간 무료로 제공됩니다. OpenClaw에서 openrouter/tencent/hy3:free를 사용하세요. 자세한 내용은 r/openclaw에서 확인하세요.

도슨트: 클로드 코드로 구축된 논문 분석 AI 어시스턴트
한 개발자가 Claude Code를 사용하여 업로드된 논문을 읽고, 발표하며, 질문에 답하고, 이해도를 평가하는 AI 어시스턴트 Docent를 만들었습니다. 이 프로젝트는 MIT 라이선스 하에 GitHub에서 이용 가능하며, Vercel에 데모가 있습니다.