Netflix veröffentlicht VOID: Video-Objekt- und Interaktionslöschmodell auf Hugging Face

Was VOID leistet
VOID entfernt Objekte aus Videos zusammen mit allen Interaktionen, die sie in der Szene auslösen – nicht nur sekundäre Effekte wie Schatten und Reflexionen, sondern auch physische Interaktionen wie fallende Objekte, wenn eine Person entfernt wird.
Technische Anforderungen
- Benötigt eine GPU mit 40 GB+ VRAM (z.B. A100)
- Basiert auf CogVideoX-Fun-V1.5-5b-InP
- Für Video-Inpainting mit interaktionsbewusstem Quadmask-Conditioning feinabgestimmt
- Quadmask ist eine 4-Wert-Maske, die kodiert: Hauptobjekt (entfernen), Überlappungsbereiche, betroffene Bereiche (fallende Objekte, verschobene Gegenstände) und Hintergrund (behalten)
- Auflösung: 384x672 (Standard)
- Maximale Frames: 197
- Scheduler: DDIM
- Präzision: BF16 mit FP8-Quantisierung für Speichereffizienz
Modelldateien
void_pass1.safetensors- Basis-Inpainting-Modell (erforderlich)void_pass2.safetensors- Warped-Noise-Verfeinerung für zeitliche Konsistenz (optional)
Pass 1 ist für die meisten Videos ausreichend. Pass 2 fügt eine optisch flussverzerrte latente Initialisierung für verbesserte zeitliche Konsistenz bei längeren Clips hinzu.
Schnellstart
Das enthaltene Notebook übernimmt das Setup, lädt Modelle herunter, führt Inferenz auf einem Beispielvideo durch und zeigt das Ergebnis an.
git clone https://github.com/netflix/void-model.git
cd void-modelCLI-Verwendung
# Abhängigkeiten installieren
pip install -r requirements.txt
Basismodell herunterladen
huggingface-cli download alibaba-pai/CogVideoX-Fun-V1.5-5b-InP
--local-dir ./CogVideoX-Fun-V1.5-5b-InP
VOID-Checkpoints herunterladen
huggingface-cli download netflix/void-model
--local-dir .
Pass-1-Inferenz auf einem Beispiel ausführen
python inference/cogvideox_fun/predict_v2v.py
--config config/quadmask_cogvideox.py
--config.data.data_rootdir= "./sample"
--config.experiment.run_seqs= "lime"
--config.experiment.save_path= "./outputs"
--config.video_model.transformer_path= "./void_pass1.safetensors"
Eingabeformat
Jedes Video benötigt drei Dateien in einem Ordner:
input_video.mp4- Quellvideoquadmask_0.mp4- 4-Wert-Maske (0=entfernen, 63=überlappen, 127=betroffen, 255=behalten)prompt.json- {"bg": "Beschreibung der Szene nach der Entfernung"}
Das Repo enthält eine Maskenerzeugungspipeline (VLM-MASK-REASONER/), die Quadmasken aus Rohvideos mit SAM2 + Gemini erstellt.
Trainingsdetails
- Trainiert auf gepaarten kontrafaktischen Videos, die aus zwei Quellen generiert wurden: HUMOTO (Mensch-Objekt-Interaktionen, in Blender mit Physiksimulation gerendert) und Kubric (nur Objekt-Interaktionen mit Google Scanned Objects)
- Das Training wurde auf 8x A100 80GB GPUs mit DeepSpeed ZeRO Stage 2 durchgeführt
Architektur
- Basis: CogVideoX 3D Transformer (5B Parameter)
- Eingabe: Video + Quadmask + Text-Prompt, der die Szene nach der Entfernung beschreibt
📖 Read the full source: HN AI Agents
👀 Siehe auch

Open-Source-Kontextpakete für rechtliche, Compliance- und Finanzfragen
Ein Entwickler nutzte Claude, um 32 kostenlose, quelloffene Kontextpakete zu recherchieren und zu erstellen, die spezifische Antworten auf rechtliche, Compliance- und Finanzfragen liefern, anstatt generische 'Konsultieren Sie einen Anwalt'-Antworten. Die Pakete behandeln Themen wie DSGVO, Verträge, SaaS-Abrechnung, den EU-KI-Akt und mehr.

Inoffizieller Ultrahuman Ring MCP Server für die Integration von KI-Agenten
Ein von der Community entwickelter MCP-Server kapselt die Ultrahuman Partner API und ermöglicht es KI-Coding-Agents, direkt über strukturierte Datenabfragen auf Ring- und CGM-Metriken wie Schlaf, HRV, Glukose und Recovery-Scores zuzugreifen.

Orchino: Lokales Multi-Agenten-Orchestrierungssystem für Windows mit paralleler Browser- und UI-Automatisierung
Orchino ist ein lokales Multi-Agenten-Orchestrierungssystem für Windows, das parallele Browser- und Windows-Aufgaben ausführt, ohne die Benutzeroberfläche zu übernehmen. Eine Demo zeigt, wie 4 Agenten die Aufgabe 'Sony-Kopfhörer auf Flipkart und Amazon suchen, Ergebnisse per E-Mail senden, in Notepad speichern' in 29,5 Sekunden mittels echter Parallelausführung erledigen.

devopsiphai: Open-Source-Claude-Code prüft die Betriebsgesundheit in 6 Phasen
devopsiphai ist eine Open-Source-Claude-Code-Fähigkeit, die die Betriebsbereitschaft von Produktionsprojekten mithilfe eines 6-Phasen-Prozesses und des ARC-Frameworks überprüft und dabei Buchstabennoten sowie eine strukturierte TODO.md mit aufwandgeschätzten Aufgaben ausgibt.