Netflix veröffentlicht VOID: Video-Objekt- und Interaktionslöschmodell auf Hugging Face

✍️ OpenClawRadar📅 Veröffentlicht: 14. April 2026🔗 Source
Netflix veröffentlicht VOID: Video-Objekt- und Interaktionslöschmodell auf Hugging Face
Ad

Was VOID leistet

VOID entfernt Objekte aus Videos zusammen mit allen Interaktionen, die sie in der Szene auslösen – nicht nur sekundäre Effekte wie Schatten und Reflexionen, sondern auch physische Interaktionen wie fallende Objekte, wenn eine Person entfernt wird.

Technische Anforderungen

  • Benötigt eine GPU mit 40 GB+ VRAM (z.B. A100)
  • Basiert auf CogVideoX-Fun-V1.5-5b-InP
  • Für Video-Inpainting mit interaktionsbewusstem Quadmask-Conditioning feinabgestimmt
  • Quadmask ist eine 4-Wert-Maske, die kodiert: Hauptobjekt (entfernen), Überlappungsbereiche, betroffene Bereiche (fallende Objekte, verschobene Gegenstände) und Hintergrund (behalten)
  • Auflösung: 384x672 (Standard)
  • Maximale Frames: 197
  • Scheduler: DDIM
  • Präzision: BF16 mit FP8-Quantisierung für Speichereffizienz

Modelldateien

  • void_pass1.safetensors - Basis-Inpainting-Modell (erforderlich)
  • void_pass2.safetensors - Warped-Noise-Verfeinerung für zeitliche Konsistenz (optional)

Pass 1 ist für die meisten Videos ausreichend. Pass 2 fügt eine optisch flussverzerrte latente Initialisierung für verbesserte zeitliche Konsistenz bei längeren Clips hinzu.

Schnellstart

Das enthaltene Notebook übernimmt das Setup, lädt Modelle herunter, führt Inferenz auf einem Beispielvideo durch und zeigt das Ergebnis an.

git clone https://github.com/netflix/void-model.git
cd void-model
Ad

CLI-Verwendung

# Abhängigkeiten installieren
pip install -r requirements.txt

Basismodell herunterladen

huggingface-cli download alibaba-pai/CogVideoX-Fun-V1.5-5b-InP
--local-dir ./CogVideoX-Fun-V1.5-5b-InP

VOID-Checkpoints herunterladen

huggingface-cli download netflix/void-model
--local-dir .

Pass-1-Inferenz auf einem Beispiel ausführen

python inference/cogvideox_fun/predict_v2v.py
--config config/quadmask_cogvideox.py
--config.data.data_rootdir= "./sample"
--config.experiment.run_seqs= "lime"
--config.experiment.save_path= "./outputs"
--config.video_model.transformer_path= "./void_pass1.safetensors"

Eingabeformat

Jedes Video benötigt drei Dateien in einem Ordner:

  • input_video.mp4 - Quellvideo
  • quadmask_0.mp4 - 4-Wert-Maske (0=entfernen, 63=überlappen, 127=betroffen, 255=behalten)
  • prompt.json - {"bg": "Beschreibung der Szene nach der Entfernung"}

Das Repo enthält eine Maskenerzeugungspipeline (VLM-MASK-REASONER/), die Quadmasken aus Rohvideos mit SAM2 + Gemini erstellt.

Trainingsdetails

  • Trainiert auf gepaarten kontrafaktischen Videos, die aus zwei Quellen generiert wurden: HUMOTO (Mensch-Objekt-Interaktionen, in Blender mit Physiksimulation gerendert) und Kubric (nur Objekt-Interaktionen mit Google Scanned Objects)
  • Das Training wurde auf 8x A100 80GB GPUs mit DeepSpeed ZeRO Stage 2 durchgeführt

Architektur

  • Basis: CogVideoX 3D Transformer (5B Parameter)
  • Eingabe: Video + Quadmask + Text-Prompt, der die Szene nach der Entfernung beschreibt

📖 Read the full source: HN AI Agents

Ad

👀 Siehe auch

Open-Source-Kontextpakete für rechtliche, Compliance- und Finanzfragen
Werkzeuge

Open-Source-Kontextpakete für rechtliche, Compliance- und Finanzfragen

Ein Entwickler nutzte Claude, um 32 kostenlose, quelloffene Kontextpakete zu recherchieren und zu erstellen, die spezifische Antworten auf rechtliche, Compliance- und Finanzfragen liefern, anstatt generische 'Konsultieren Sie einen Anwalt'-Antworten. Die Pakete behandeln Themen wie DSGVO, Verträge, SaaS-Abrechnung, den EU-KI-Akt und mehr.

OpenClawRadar
Inoffizieller Ultrahuman Ring MCP Server für die Integration von KI-Agenten
Werkzeuge

Inoffizieller Ultrahuman Ring MCP Server für die Integration von KI-Agenten

Ein von der Community entwickelter MCP-Server kapselt die Ultrahuman Partner API und ermöglicht es KI-Coding-Agents, direkt über strukturierte Datenabfragen auf Ring- und CGM-Metriken wie Schlaf, HRV, Glukose und Recovery-Scores zuzugreifen.

OpenClawRadar
Orchino: Lokales Multi-Agenten-Orchestrierungssystem für Windows mit paralleler Browser- und UI-Automatisierung
Werkzeuge

Orchino: Lokales Multi-Agenten-Orchestrierungssystem für Windows mit paralleler Browser- und UI-Automatisierung

Orchino ist ein lokales Multi-Agenten-Orchestrierungssystem für Windows, das parallele Browser- und Windows-Aufgaben ausführt, ohne die Benutzeroberfläche zu übernehmen. Eine Demo zeigt, wie 4 Agenten die Aufgabe 'Sony-Kopfhörer auf Flipkart und Amazon suchen, Ergebnisse per E-Mail senden, in Notepad speichern' in 29,5 Sekunden mittels echter Parallelausführung erledigen.

OpenClawRadar
devopsiphai: Open-Source-Claude-Code prüft die Betriebsgesundheit in 6 Phasen
Werkzeuge

devopsiphai: Open-Source-Claude-Code prüft die Betriebsgesundheit in 6 Phasen

devopsiphai ist eine Open-Source-Claude-Code-Fähigkeit, die die Betriebsbereitschaft von Produktionsprojekten mithilfe eines 6-Phasen-Prozesses und des ARC-Frameworks überprüft und dabei Buchstabennoten sowie eine strukturierte TODO.md mit aufwandgeschätzten Aufgaben ausgibt.

OpenClawRadar