PhAIL 벤치마크, 실제 창고 로봇 작업에서 VLA 모델 성능 평가

✍️ OpenClawRadar📅 게시일: April 1, 2026🔗 Source
PhAIL 벤치마크, 실제 창고 로봇 작업에서 VLA 모델 성능 평가
Ad

PhAIL은 비전-언어-액션(VLA) 모델이 상업용 로봇 공학 작업에서 얼마나 잘 수행하는지 측정하는 물리적 AI 벤치마크입니다. 제작자는 이러한 모델들의 실제 응용 분야에서 정직한 성능 수치를 찾을 수 없어 이를 구축했습니다.

벤치마크 세부사항

이 벤치마크는 가장 일반적인 창고 작업 중 하나인 빈-투-빈 주문 피킹 작업에서 4가지 VLA 모델을 테스트합니다:

  • OpenPI/pi0.5
  • GR00T
  • ACT
  • SmolVLA

모든 테스트는 동일한 장비를 사용합니다: Robotiq 2F-85 그리퍼(DROID 설정)가 장착된 Franka FR3 로봇으로, 운영자가 어떤 모델이 실행 중인지 모르는 수백 번의 블라인드 실행에서 동일한 객체를 사용합니다.

성능 결과

벤치마크는 상당한 성능 격차를 드러냈습니다:

  • 최고 모델 성능: 시간당 64개 단위(UPH)
  • 동일한 로봇을 인간이 원격 조작: 330 UPH
  • 인간이 수동으로 작업 수행: 1,300+ UPH

공개 데이터 및 방법론

벤치마크의 모든 것이 공개적으로 이용 가능합니다:

  • 동기화된 비디오 및 원격 측정 데이터가 포함된 모든 실행
  • 훈련에 사용된 미세 조정 데이터셋
  • 훈련 스크립트
  • 새로운 제출을 받아들이는 공개 리더보드

제작자는 방법론, 테스트된 특정 모델, 또는 벤치마크 실행 관찰에 관한 질문에 답변할 수 있습니다.

📖 Read the full source: HN AI Agents

Ad

👀 See Also

Audacity MCP 서버, Claude AI에 완전한 오디오 편집 제어권 부여
Tools

Audacity MCP 서버, Claude AI에 완전한 오디오 편집 제어권 부여

한 개발자가 Claude AI를 Audacity에 연결하는 MCP 서버를 구축하여, 자연어 오디오 편집 명령을 위한 99가지 도구를 제공합니다. 이 오픈소스 도구는 Claude Desktop, Claude Code 또는 Cursor와 함께 작동합니다.

OpenClawRadar
VibeIndex.ai: 90,000개 이상의 AI 기술, MCP 및 플러그인을 보안 검사와 함께 검색할 수 있는 허브
Tools

VibeIndex.ai: 90,000개 이상의 AI 기술, MCP 및 플러그인을 보안 검사와 함께 검색할 수 있는 허브

한국인 AI 연구자가 vibeindex.ai를 구축했습니다. 이는 17개 위협 범주에 걸쳐 시스코 스킬 스캐너를 사용하여 시간별 업데이트와 보안 스캐닝을 통해 90,000개 이상의 AI 스킬, MCP 서버, 플러그인을 인덱싱하는 검색 가능한 허브입니다.

OpenClawRadar
Freddy CLI: MCP를 통해 건강 데이터를 AI 에이전트에 연결
Tools

Freddy CLI: MCP를 통해 건강 데이터를 AI 에이전트에 연결

Freddy가 오픈소스 CLI를 출시하여 Oura, Polar, Withings 등의 웨어러블 건강 데이터를 MCP를 통해 AI 코딩 에이전트에 연결합니다. OAuth 기기 흐름, 데이터 쿼리, 토큰 갱신 명령어를 제공합니다.

OpenClawRadar
Claude-실시간-비디오: 모든 LLM을 위한 장면 인식 프레임 추출 + 대본
Tools

Claude-실시간-비디오: 모든 LLM을 위한 장면 인식 프레임 추출 + 대본

비디오에서 장면 인식, 중복 제거된 프레임과 오디오 전사를 추출하는 오픈소스 도구로, 어떤 LLM이든 업로드 없이 로컬에서 비디오를 '시청'할 수 있게 합니다. 장면 변경 감지, 슬라이딩 윈도우 중복 제거, Whisper 전사 기능을 제공합니다.

OpenClawRadar