PhAILベンチマークは、実際の倉庫ロボットタスクでVLAモデルをテストします

✍️ OpenClawRadar📅 公開日: April 1, 2026🔗 Source
PhAILベンチマークは、実際の倉庫ロボットタスクでVLAモデルをテストします
Ad

PhAILは、視覚言語行動(VLA)モデルが商用ロボティクスタスクでどの程度の性能を発揮するかを測定する物理AIベンチマークです。作成者は、これらのモデルの実用的な応用における正直な性能数値を見つけられなかったため、これを構築しました。

ベンチマーク詳細

このベンチマークは、最も一般的な倉庫作業の1つであるビン間のオーダーピッキングにおいて、4つのVLAモデルをテストします:

  • OpenPI/pi0.5
  • GR00T
  • ACT
  • SmolVLA

すべてのテストは同じ機器を使用します:Robotiq 2F-85グリッパーを備えたFranka FR3ロボット(DROIDセットアップ)で、オペレーターがどのモデルが実行されているか知らない数百回のブラインドランで同一のオブジェクトを使用します。

性能結果

ベンチマークは、大きな性能差を明らかにしました:

  • 最高のモデル性能:1時間あたり64ユニット(UPH)
  • 同じロボットを人間が遠隔操作:330 UPH
  • 人間が手作業でタスクを実行:1,300+ UPH

オープンデータと方法論

ベンチマークからのすべてが公開されています:

  • 同期されたビデオとテレメトリデータを含むすべての実行
  • トレーニングに使用された微調整データセット
  • トレーニングスクリプト
  • 新しい提出を受け付けるオープンリーダーボード

作成者は、方法論、テストされた特定のモデル、またはベンチマーク実行からの観察に関する質問に答えることができます。

📖 Read the full source: HN AI Agents

Ad

👀 See Also

CSSモダン機能エージェントスキル:AIコーディングエージェントにおけるモダンCSSプラクティスの強制
Tools

CSSモダン機能エージェントスキル:AIコーディングエージェントにおけるモダンCSSプラクティスの強制

カラー、レイアウト、セレクタ、アニメーション、タイポグラフィ、ポジショニング、コンポーネントパターンにわたる57以上のモダンCSS機能を強制するエージェントスキル。Claude Code、Cursor、Windsurf、Codex、Cline、GitHub Copilotに対応。

OpenClawRadar
AIコーディングツールの実質コスト:60日あたり42時間のオーバーヘッド — ソロ開発者の詳細な内訳
Tools

AIコーディングツールの実質コスト:60日あたり42時間のオーバーヘッド — ソロ開発者の詳細な内訳

とある個人開発者が、AIコーディングツールに費やした1ドルと1分を60日間追跡した。サブスクリプション費用(月200ドル)は最小のコストで、悪い出力とツール切り替えによる42時間のオーバーヘッドが本当の負担だった。正味の生産性向上は1.7〜2倍であり、10倍ではなかった。驚くべきことに、月15ドルのレビューツール「CodeRabbit」が最も高いROIを示した。

OpenClawRadar
ベンチマーク:24GB Mac MiniでのGemma4 12Bと量子化版Qwen3 8Bの比較
Tools

ベンチマーク:24GB Mac MiniでのGemma4 12Bと量子化版Qwen3 8Bの比較

開発者がGemma4 12BとQwen3:8b-q4_K_Mを24GB Mac Miniで2つのプロンプトを使ってテストしました。Qwen3はプロンプト処理が4〜5倍速く、Gemma4は出力生成がわずかに速い結果でした。

OpenClawRadar
Conduid.comは23,000以上のMCPサーバーを検索可能なディレクトリにインデックス化しています。
Tools

Conduid.comは23,000以上のMCPサーバーを検索可能なディレクトリにインデックス化しています。

Conduid.comは11のソースからMCPサーバーを集約し、重複を排除して、GitHubのアクティビティ、ドキュメントの品質、メンテナンスの状況に基づいた検索、カテゴリ、信頼スコアを提供します。

OpenClawRadar