Netflix lanza VOID: Modelo de Eliminación de Objetos e Interacciones en Video en Hugging Face

Qué hace VOID
VOID elimina objetos de los videos junto con todas las interacciones que inducen en la escena — no solo efectos secundarios como sombras y reflejos, sino interacciones físicas como objetos que caen cuando se elimina una persona.
Requisitos técnicos
- Requiere una GPU con 40GB+ de VRAM (por ejemplo, A100)
- Basado en CogVideoX-Fun-V1.5-5b-InP
- Afinado para restauración de video con condicionamiento de máscara cuádruple consciente de interacciones
- La máscara cuádruple es una máscara de 4 valores que codifica: objeto principal (eliminar), regiones superpuestas, regiones afectadas (objetos que caen, elementos desplazados) y fondo (conservar)
- Resolución: 384x672 (predeterminado)
- Máximo de fotogramas: 197
- Programador: DDIM
- Precisión: BF16 con cuantización FP8 para eficiencia de memoria
Archivos del modelo
void_pass1.safetensors- Modelo base de restauración (requerido)void_pass2.safetensors- Refinamiento de ruido deformado para consistencia temporal (opcional)
El Paso 1 es suficiente para la mayoría de los videos. El Paso 2 agrega inicialización latente deformada por flujo óptico para mejorar la consistencia temporal en clips más largos.
Inicio rápido
El cuaderno incluido maneja la configuración, descarga los modelos, ejecuta la inferencia en un video de muestra y muestra el resultado.
git clone https://github.com/netflix/void-model.git
cd void-modelUso de CLI
# Instalar dependencias
pip install -r requirements.txt
Descargar el modelo base
huggingface-cli download alibaba-pai/CogVideoX-Fun-V1.5-5b-InP
--local-dir ./CogVideoX-Fun-V1.5-5b-InP
Descargar puntos de control de VOID
huggingface-cli download netflix/void-model
--local-dir .
Ejecutar inferencia del Paso 1 en una muestra
python inference/cogvideox_fun/predict_v2v.py
--config config/quadmask_cogvideox.py
--config.data.data_rootdir= "./sample"
--config.experiment.run_seqs= "lime"
--config.experiment.save_path= "./outputs"
--config.video_model.transformer_path= "./void_pass1.safetensors"
Formato de entrada
Cada video necesita tres archivos en una carpeta:
input_video.mp4- video fuentequadmask_0.mp4- máscara de 4 valores (0=eliminar, 63=superponer, 127=afectado, 255=conservar)prompt.json- {"bg": "descripción de la escena después de la eliminación"}
El repositorio incluye una canalización de generación de máscaras (VLM-MASK-REASONER/) que crea máscaras cuádruples a partir de videos sin procesar usando SAM2 + Gemini.
Detalles del entrenamiento
- Entrenado con videos contrafactuales emparejados generados de dos fuentes: HUMOTO (interacciones humano-objeto renderizadas en Blender con simulación física) y Kubric (interacciones solo de objetos usando Google Scanned Objects)
- El entrenamiento se ejecutó en 8x GPUs A100 80GB usando DeepSpeed ZeRO Stage 2
Arquitectura
- Base: CogVideoX 3D Transformer (5B parámetros)
- Entrada: Video + máscara cuádruple + indicación de texto que describe la escena después de la eliminación
📖 Leer la fuente completa: HN AI Agents
👀 Ver también

MCP Server conecta Claude Code/Desktop a Apple Music — Listas de reproducción, Búsqueda, Análisis de perfil
Un nuevo servidor MCP permite que Claude Code y Claude Desktop controlen Apple Music: listar listas de reproducción, buscar canciones, crear listas de reproducción y analizar patrones de escucha mediante lenguaje natural.

Código de Claude de código abierto, ingeniería inversa realizada usando Claude
Un desarrollador utilizó Claude para reescribir los 26 prompts del código fuente de Claude Code después de estudiar la base de código TypeScript durante una breve ventana de disponibilidad pública. La colección con licencia MIT incluye prompts de sistema, herramientas, agentes, memoria, coordinador y utilidades.

obsidian-mcp: Servidor MCP consciente del grafo para Claude con 25 herramientas orientadas a bóvedas grandes
obsidian-mcp es un servidor MCP que expone 25 herramientas (incluyendo get_note, traverse_graph, query_dataview, move_note, create_notes) que le da a Claude acceso consciente del grafo a tu bóveda de Obsidian, evitando la muerte del contexto en bóvedas de 5000 notas. MIT, funciona con Claude Desktop, Claude Code, Cursor, Cline, Continue, Zed.

Sovr MCP Proxy agrega una capa de seguridad para prevenir comandos destructivos de LLM.
Un desarrollador creó sovr-mcp-proxy después de que un LLM local casi ejecutó rm -rf en su carpeta personal. La herramienta intercepta comandos antes de su ejecución y bloquea patrones destructivos que incluyen rm -rf, DROP TABLE, curl | sh y chmod 777.