PhAIL-Benchmark-Tests testen VLA-Modelle an echten Lagerhaus-Roboteraufgaben

PhAIL ist ein physischer KI-Benchmark, der misst, wie gut Vision-Language-Action (VLA)-Modelle bei kommerziellen Robotikaufgaben abschneiden. Der Ersteller entwickelte ihn, weil er keine ehrlichen Leistungsdaten für diese Modelle in praktischen Anwendungen finden konnte.
Benchmark-Details
Der Benchmark testet vier VLA-Modelle bei der Behälter-zu-Behälter-Kommissionierung, einer der häufigsten Lagerhausoperationen:
- OpenPI/pi0.5
- GR00T
- ACT
- SmolVLA
Alle Tests verwenden die gleiche Ausrüstung: einen Franka FR3 Roboter mit Robotiq 2F-85 Greifer (DROID-Setup), mit identischen Objekten über hunderte von Blindläufen, bei denen der Bediener nicht weiß, welches Modell gerade läuft.
Leistungsergebnisse
Der Benchmark zeigte erhebliche Leistungsunterschiede:
- Beste Modellleistung: 64 Einheiten pro Stunde (UPH)
- Menschliche Teleoperation desselben Roboters: 330 UPH
- Menschliche manuelle Ausführung der Aufgabe: über 1.300 UPH
Offene Daten und Methodik
Alles vom Benchmark ist öffentlich verfügbar:
- Jeder Lauf mit synchronisierten Video- und Telemetriedaten
- Der Feinabstimmungsdatensatz, der für das Training verwendet wurde
- Trainingsskripte
- Eine offene Bestenliste, die neue Einreichungen akzeptiert
Der Ersteller steht für Fragen zur Methodik, den getesteten Modellen oder Beobachtungen aus den Benchmark-Läufen zur Verfügung.
📖 Read the full source: HN AI Agents
👀 Siehe auch

Kelet: Automatisierte Root-Cause-Analyse für KI-Agenten
Kelet ist ein Dienst, der automatisch Fehler von KI-Agenten in der Produktion analysiert, indem er Traces und Signale clustert, um Ursachen zu identifizieren und Lösungen vorzuschlagen. Er lässt sich über Python-/TypeScript-SDKs oder eine Installer-Skill integrieren und ist während der Beta-Phase derzeit kostenlos.

AI mit kleinen Bots erkunden: Künstliche Intelligenz-Agenten durch Nanobot-Tutoren verstehen
Ein Mitglied der OpenClaw-Community teilt Einblicke in den 'Nanobot Tutor', ein kompaktes Framework, das darauf abzielt, die Funktionsweise von KI-Agenten zu entmystifizieren. Entdecken Sie, wie das Eintauchen in diese kompakte Lernumgebung die Arbeitsweise intelligenter Agenten enthüllt.
Claude Code v2.1.238: keybindingFlavor, headersHelper, Self-Hosted-Runner-Fixes
Claude Code v2.1.238 fügt keybindingFlavor=readline für Ctrl+W, headersHelper für Plugin-Marktplätze, selbst gehostete Runner-Flags für Shutdown und Proxy-Auth sowie zahlreiche Fehlerbehebungen hinzu.

Aufbau eines sprachgesteuerten Multi-Agenten-Systems auf Basis von Claude Code
Ein Entwickler baute eine sprachgesteuerte Wake-Word-Schleife für Claude Code, die Unter-Agents spawnen, Arbeit parallelisieren und Ergebnisse automatisch einer Qualitätssicherung unterzieht. Vollständige technische Aufschlüsselung inklusive Sprecherverifizierung und PID-Watcher.