Netflix veröffentlicht VOID: Video-Objekt- und Interaktionslöschmodell auf Hugging Face

✍️ OpenClawRadar📅 Veröffentlicht: 14. April 2026🔗 Source
Netflix veröffentlicht VOID: Video-Objekt- und Interaktionslöschmodell auf Hugging Face
Ad

Was VOID leistet

VOID entfernt Objekte aus Videos zusammen mit allen Interaktionen, die sie in der Szene auslösen – nicht nur sekundäre Effekte wie Schatten und Reflexionen, sondern auch physische Interaktionen wie fallende Objekte, wenn eine Person entfernt wird.

Technische Anforderungen

  • Benötigt eine GPU mit 40 GB+ VRAM (z.B. A100)
  • Basiert auf CogVideoX-Fun-V1.5-5b-InP
  • Für Video-Inpainting mit interaktionsbewusstem Quadmask-Conditioning feinabgestimmt
  • Quadmask ist eine 4-Wert-Maske, die kodiert: Hauptobjekt (entfernen), Überlappungsbereiche, betroffene Bereiche (fallende Objekte, verschobene Gegenstände) und Hintergrund (behalten)
  • Auflösung: 384x672 (Standard)
  • Maximale Frames: 197
  • Scheduler: DDIM
  • Präzision: BF16 mit FP8-Quantisierung für Speichereffizienz

Modelldateien

  • void_pass1.safetensors - Basis-Inpainting-Modell (erforderlich)
  • void_pass2.safetensors - Warped-Noise-Verfeinerung für zeitliche Konsistenz (optional)

Pass 1 ist für die meisten Videos ausreichend. Pass 2 fügt eine optisch flussverzerrte latente Initialisierung für verbesserte zeitliche Konsistenz bei längeren Clips hinzu.

Schnellstart

Das enthaltene Notebook übernimmt das Setup, lädt Modelle herunter, führt Inferenz auf einem Beispielvideo durch und zeigt das Ergebnis an.

git clone https://github.com/netflix/void-model.git
cd void-model
Ad

CLI-Verwendung

# Abhängigkeiten installieren
pip install -r requirements.txt

Basismodell herunterladen

huggingface-cli download alibaba-pai/CogVideoX-Fun-V1.5-5b-InP
--local-dir ./CogVideoX-Fun-V1.5-5b-InP

VOID-Checkpoints herunterladen

huggingface-cli download netflix/void-model
--local-dir .

Pass-1-Inferenz auf einem Beispiel ausführen

python inference/cogvideox_fun/predict_v2v.py
--config config/quadmask_cogvideox.py
--config.data.data_rootdir= "./sample"
--config.experiment.run_seqs= "lime"
--config.experiment.save_path= "./outputs"
--config.video_model.transformer_path= "./void_pass1.safetensors"

Eingabeformat

Jedes Video benötigt drei Dateien in einem Ordner:

  • input_video.mp4 - Quellvideo
  • quadmask_0.mp4 - 4-Wert-Maske (0=entfernen, 63=überlappen, 127=betroffen, 255=behalten)
  • prompt.json - {"bg": "Beschreibung der Szene nach der Entfernung"}

Das Repo enthält eine Maskenerzeugungspipeline (VLM-MASK-REASONER/), die Quadmasken aus Rohvideos mit SAM2 + Gemini erstellt.

Trainingsdetails

  • Trainiert auf gepaarten kontrafaktischen Videos, die aus zwei Quellen generiert wurden: HUMOTO (Mensch-Objekt-Interaktionen, in Blender mit Physiksimulation gerendert) und Kubric (nur Objekt-Interaktionen mit Google Scanned Objects)
  • Das Training wurde auf 8x A100 80GB GPUs mit DeepSpeed ZeRO Stage 2 durchgeführt

Architektur

  • Basis: CogVideoX 3D Transformer (5B Parameter)
  • Eingabe: Video + Quadmask + Text-Prompt, der die Szene nach der Entfernung beschreibt

📖 Read the full source: HN AI Agents

Ad

👀 Siehe auch

VibeIndex.ai: Durchsuchbare Plattform für 90.000+ KI-Fähigkeiten, MCPs und Plugins mit Sicherheitsüberprüfung
Werkzeuge

VibeIndex.ai: Durchsuchbare Plattform für 90.000+ KI-Fähigkeiten, MCPs und Plugins mit Sicherheitsüberprüfung

Ein koreanischer KI-Forscher hat vibeindex.ai entwickelt, eine durchsuchbare Plattform, die über 90.000 KI-Fähigkeiten, MCP-Server und Plugins mit stündlichen Updates und Sicherheitsscans mithilfe des Cisco Skill Scanners über 17 Bedrohungskategorien hinweg indexiert.

OpenClawRadar
AutoSkillUpdate: Ein Claude-Code-Plugin, das veraltete Fähigkeiten erkennt
Werkzeuge

AutoSkillUpdate: Ein Claude-Code-Plugin, das veraltete Fähigkeiten erkennt

AutoSkillUpdate ist ein Open-Source-Claude-Code-Plugin, das Ihre Codebasis scannt, sie mit vorhandenen Skills vergleicht und Abweichungen identifiziert. Es liefert Abweichungsberichte mit Dateipfaden und Zeilenreferenzen und bietet dann an, veraltete Skills nach Benutzerbestätigung neu zu schreiben.

OpenClawRadar
Neues Tool injiziert Anweisungen in Claude Code basierend auf Kontextnutzung
Werkzeuge

Neues Tool injiziert Anweisungen in Claude Code basierend auf Kontextnutzung

Ein Entwickler hat ein Tool erstellt, das die Kontextnutzung ueberwacht und benutzerdefinierte Anweisungen injiziert.

OpenClaw Radar
Membase: Externer Speicherlayer für KI-Assistenten über Tools hinweg
Werkzeuge

Membase: Externer Speicherlayer für KI-Assistenten über Tools hinweg

Membase ist eine externe Speicherschicht, die Konversationskontext extrahiert und in einem Wissensgraphen speichert, um dann relevante Erinnerungen in neue Chats bei Claude, ChatGPT, Cursor, Gemini und anderen KI-Tools einzufügen. Es befindet sich derzeit in einer geschlossenen Beta mit allen Funktionen kostenlos.

OpenClawRadar