PhAILベンチマークは、実際の倉庫ロボットタスクでVLAモデルをテストします

PhAILは、視覚言語行動(VLA)モデルが商用ロボティクスタスクでどの程度の性能を発揮するかを測定する物理AIベンチマークです。作成者は、これらのモデルの実用的な応用における正直な性能数値を見つけられなかったため、これを構築しました。
ベンチマーク詳細
このベンチマークは、最も一般的な倉庫作業の1つであるビン間のオーダーピッキングにおいて、4つのVLAモデルをテストします:
- OpenPI/pi0.5
- GR00T
- ACT
- SmolVLA
すべてのテストは同じ機器を使用します:Robotiq 2F-85グリッパーを備えたFranka FR3ロボット(DROIDセットアップ)で、オペレーターがどのモデルが実行されているか知らない数百回のブラインドランで同一のオブジェクトを使用します。
性能結果
ベンチマークは、大きな性能差を明らかにしました:
- 最高のモデル性能:1時間あたり64ユニット(UPH)
- 同じロボットを人間が遠隔操作:330 UPH
- 人間が手作業でタスクを実行:1,300+ UPH
オープンデータと方法論
ベンチマークからのすべてが公開されています:
- 同期されたビデオとテレメトリデータを含むすべての実行
- トレーニングに使用された微調整データセット
- トレーニングスクリプト
- 新しい提出を受け付けるオープンリーダーボード
作成者は、方法論、テストされた特定のモデル、またはベンチマーク実行からの観察に関する質問に答えることができます。
📖 Read the full source: HN AI Agents
👀 See Also

Airbyteエージェント:AIエージェント向け事前インデックス化コンテキストレイヤー vs 生APIのMCP
AirbyteがAirbyte Agentsを発表。これは、Slack、Salesforce、Linear、Zendesk、Gongなどの運用システムからデータを事前にインデックス化するコンテキストレイヤーで、直接ベンダーMCPと比較してエージェントのトークン消費を最大90%削減します。

Hollow AgentOS: Qwen 3.5 9Bを使ってClaude風エージェントをRTX 5070でローカル実行
ローカルハードウェア上で動作するQwen 3.5 9Bを使用した自己修正エージェントシステムが、Claude APIコストを50%削減。反復的なテストと自己改善ループにより、人間の介入なしでソフトウェア開発を行う。

通过开源通用集成层将AI工具连接到共享上下文总线
Viaは、Claude、Cursor、Windsurf、ChatGPT、LangChainなどのAIツールを共有のコンテキスト、タスク、メモリバスに接続するオープンソースのユニバーサル統合レイヤーで、ツールやセッション、マシンをまたいで作業を追跡できるようにします。

デバッグ:Claude Codeのビルドチェックロジック — 名前検索が失敗し構造的フットプリント検索が修正する理由
Claude Codeがユーザーに「機能は構築されていない」と1セッションで4回も告げた——すべて間違い。修正方法:名前ベースの検索を構造的フットプリント検索(ルート、スキーマ、登録ツール)に置き換える。実用的なルールを共有。