PhAIL-Benchmark-Tests testen VLA-Modelle an echten Lagerhaus-Roboteraufgaben

✍️ OpenClawRadar📅 Veröffentlicht: 1. April 2026🔗 Source
PhAIL-Benchmark-Tests testen VLA-Modelle an echten Lagerhaus-Roboteraufgaben
Ad

PhAIL ist ein physischer KI-Benchmark, der misst, wie gut Vision-Language-Action (VLA)-Modelle bei kommerziellen Robotikaufgaben abschneiden. Der Ersteller entwickelte ihn, weil er keine ehrlichen Leistungsdaten für diese Modelle in praktischen Anwendungen finden konnte.

Benchmark-Details

Der Benchmark testet vier VLA-Modelle bei der Behälter-zu-Behälter-Kommissionierung, einer der häufigsten Lagerhausoperationen:

  • OpenPI/pi0.5
  • GR00T
  • ACT
  • SmolVLA

Alle Tests verwenden die gleiche Ausrüstung: einen Franka FR3 Roboter mit Robotiq 2F-85 Greifer (DROID-Setup), mit identischen Objekten über hunderte von Blindläufen, bei denen der Bediener nicht weiß, welches Modell gerade läuft.

Ad

Leistungsergebnisse

Der Benchmark zeigte erhebliche Leistungsunterschiede:

  • Beste Modellleistung: 64 Einheiten pro Stunde (UPH)
  • Menschliche Teleoperation desselben Roboters: 330 UPH
  • Menschliche manuelle Ausführung der Aufgabe: über 1.300 UPH

Offene Daten und Methodik

Alles vom Benchmark ist öffentlich verfügbar:

  • Jeder Lauf mit synchronisierten Video- und Telemetriedaten
  • Der Feinabstimmungsdatensatz, der für das Training verwendet wurde
  • Trainingsskripte
  • Eine offene Bestenliste, die neue Einreichungen akzeptiert

Der Ersteller steht für Fragen zur Methodik, den getesteten Modellen oder Beobachtungen aus den Benchmark-Läufen zur Verfügung.

📖 Read the full source: HN AI Agents

Ad

👀 Siehe auch

Kelet: Automatisierte Root-Cause-Analyse für KI-Agenten
Werkzeuge

Kelet: Automatisierte Root-Cause-Analyse für KI-Agenten

Kelet ist ein Dienst, der automatisch Fehler von KI-Agenten in der Produktion analysiert, indem er Traces und Signale clustert, um Ursachen zu identifizieren und Lösungen vorzuschlagen. Er lässt sich über Python-/TypeScript-SDKs oder eine Installer-Skill integrieren und ist während der Beta-Phase derzeit kostenlos.

OpenClawRadar
AI mit kleinen Bots erkunden: Künstliche Intelligenz-Agenten durch Nanobot-Tutoren verstehen
Werkzeuge

AI mit kleinen Bots erkunden: Künstliche Intelligenz-Agenten durch Nanobot-Tutoren verstehen

Ein Mitglied der OpenClaw-Community teilt Einblicke in den 'Nanobot Tutor', ein kompaktes Framework, das darauf abzielt, die Funktionsweise von KI-Agenten zu entmystifizieren. Entdecken Sie, wie das Eintauchen in diese kompakte Lernumgebung die Arbeitsweise intelligenter Agenten enthüllt.

OpenClawRadar
🦀
Werkzeuge

Claude Code v2.1.238: keybindingFlavor, headersHelper, Self-Hosted-Runner-Fixes

Claude Code v2.1.238 fügt keybindingFlavor=readline für Ctrl+W, headersHelper für Plugin-Marktplätze, selbst gehostete Runner-Flags für Shutdown und Proxy-Auth sowie zahlreiche Fehlerbehebungen hinzu.

OpenClawRadar
Aufbau eines sprachgesteuerten Multi-Agenten-Systems auf Basis von Claude Code
Werkzeuge

Aufbau eines sprachgesteuerten Multi-Agenten-Systems auf Basis von Claude Code

Ein Entwickler baute eine sprachgesteuerte Wake-Word-Schleife für Claude Code, die Unter-Agents spawnen, Arbeit parallelisieren und Ergebnisse automatisch einer Qualitätssicherung unterzieht. Vollständige technische Aufschlüsselung inklusive Sprecherverifizierung und PID-Watcher.

OpenClawRadar