Netflix Lança VOID: Modelo de Exclusão de Objetos e Interações em Vídeo no Hugging Face

✍️ OpenClawRadar📅 Publicado: April 14, 2026🔗 Source
Netflix Lança VOID: Modelo de Exclusão de Objetos e Interações em Vídeo no Hugging Face
Ad

O que o VOID faz

O VOID remove objetos de vídeos juntamente com todas as interações que eles induzem na cena — não apenas efeitos secundários como sombras e reflexos, mas interações físicas como objetos caindo quando uma pessoa é removida.

Requisitos Técnicos

  • Requer uma GPU com 40GB+ de VRAM (ex.: A100)
  • Construído sobre CogVideoX-Fun-V1.5-5b-InP
  • Fine-tuned para inpainting de vídeo com condicionamento quadmask consciente de interações
  • Quadmask é uma máscara de 4 valores que codifica: objeto primário (remover), regiões sobrepostas, regiões afetadas (objetos caindo, itens deslocados) e fundo (manter)
  • Resolução: 384x672 (padrão)
  • Máximo de frames: 197
  • Agendador: DDIM
  • Precisão: BF16 com quantização FP8 para eficiência de memória

Arquivos do Modelo

  • void_pass1.safetensors - Modelo base de inpainting (obrigatório)
  • void_pass2.safetensors - Refinamento de ruído deformado para consistência temporal (opcional)

O Passo 1 é suficiente para a maioria dos vídeos. O Passo 2 adiciona inicialização latente deformada por fluxo óptico para melhor consistência temporal em clipes mais longos.

Início Rápido

O notebook incluído lida com a configuração, baixa os modelos, executa inferência em um vídeo de amostra e exibe o resultado.

git clone https://github.com/netflix/void-model.git
cd void-model
Ad

Uso via CLI

# Instalar dependências
pip install -r requirements.txt

Baixar o modelo base

huggingface-cli download alibaba-pai/CogVideoX-Fun-V1.5-5b-InP
--local-dir ./CogVideoX-Fun-V1.5-5b-InP

Baixar os checkpoints do VOID

huggingface-cli download netflix/void-model
--local-dir .

Executar inferência do Passo 1 em uma amostra

python inference/cogvideox_fun/predict_v2v.py
--config config/quadmask_cogvideox.py
--config.data.data_rootdir= "./sample"
--config.experiment.run_seqs= "lime"
--config.experiment.save_path= "./outputs"
--config.video_model.transformer_path= "./void_pass1.safetensors"

Formato de Entrada

Cada vídeo precisa de três arquivos em uma pasta:

  • input_video.mp4 - vídeo fonte
  • quadmask_0.mp4 - máscara de 4 valores (0=remover, 63=sobreposição, 127=afetado, 255=manter)
  • prompt.json - {"bg": "descrição da cena após a remoção"}

O repositório inclui um pipeline de geração de máscaras (VLM-MASK-REASONER/) que cria quadmasks a partir de vídeos brutos usando SAM2 + Gemini.

Detalhes do Treinamento

  • Treinado em vídeos contrafactuais pareados gerados de duas fontes: HUMOTO (interações humano-objeto renderizadas no Blender com simulação física) e Kubric (interações apenas entre objetos usando Google Scanned Objects)
  • O treinamento foi executado em 8x GPUs A100 80GB usando DeepSpeed ZeRO Stage 2

Arquitetura

  • Base: CogVideoX 3D Transformer (5B parâmetros)
  • Entrada: Vídeo + quadmask + prompt de texto descrevendo a cena após a remoção

📖 Leia a fonte completa: HN AI Agents

Ad

👀 See Also

Clawdbot Lança Novos Recursos com Assinatura Pro
Tools

Clawdbot Lança Novos Recursos com Assinatura Pro

O Clawdbot apresenta uma assinatura 'Pro', oferecendo recursos aprimorados para usuários que buscam maximizar o potencial da automação em ambientes de programação. Mergulhe nos recursos mais recentes e nas percepções da comunidade do r/clawdbot.

OpenClawRadar
Modelo de Raciocínio Estruturado Melhora a Precisão da Revisão de Código por IA
Tools

Modelo de Raciocínio Estruturado Melhora a Precisão da Revisão de Código por IA

Um usuário do Reddit compartilha um modelo de raciocínio estruturado adaptado de uma pesquisa da Meta que força modelos de IA a completar etapas analíticas específicas antes de gerar revisões de código, melhorando a precisão em 5 a 12 pontos percentuais de acordo com arXiv:2603.01896.

OpenClawRadar
Qure: Aplicativo de Desktop para Gerar Testes E2E a Partir de Fluxos de Navegador Gravados
Tools

Qure: Aplicativo de Desktop para Gerar Testes E2E a Partir de Fluxos de Navegador Gravados

Qure é um aplicativo de desktop desenvolvido pela JetBrains (atualmente em beta fechado) que gera código de teste web de ponta a ponta a partir de gravações feitas em seu navegador integrado. Em vez de descrever fluxos de teste em texto para agentes de IA, os desenvolvedores gravam seus cenários de QA manual interagindo com seu produto, e a IA produz código de teste funcional que corresponde à sua base de código existente.

OpenClawRadar
Exasol lança servidor MCP para contexto de banco de dados em fluxos de trabalho de agentes de IA
Tools

Exasol lança servidor MCP para contexto de banco de dados em fluxos de trabalho de agentes de IA

A Exasol lançou um Servidor MCP que permite que bancos de dados forneçam contexto a agentes de IA sobre dados disponíveis, regras de negócio e métodos de interação seguros. O servidor é somente leitura por padrão, suporta fluxos de trabalho de alta concorrência e pode ser implantado em ambientes on-premises, na nuvem ou híbridos.

OpenClawRadar