TRELLIS.2 Image-to-3D Portado para Executar Nativamente em Apple Silicon

✍️ OpenClawRadar📅 Publicado: April 20, 2026🔗 Source
TRELLIS.2 Image-to-3D Portado para Executar Nativamente em Apple Silicon
Ad

O Que É Isso

Uma versão portada do modelo TRELLIS.2 da Microsoft para conversão de imagem em 3D que roda nativamente no Apple Silicon via PyTorch MPS, substituindo dependências exclusivas do CUDA por alternativas em PyTorch puro.

Detalhes Principais

O TRELLIS.2 original requer CUDA com flash_attn, nvdiffrast e kernels de convolução esparsa personalizados que não funcionam no Mac. Esta versão portada substitui esses componentes por:

  • Uma implementação de convolução 3D esparsa do tipo gather-scatter (backends/conv_none.py)
  • Atenção SDPA para transformadores esparsos usando scaled_dot_product_attention do PyTorch
  • Extração de malha baseada em Python substituindo operações de hashmap do CUDA (backends/mesh_extract.py)

As alterações totais são de algumas centenas de linhas em 9 arquivos. Todas as chamadas .cuda() embutidas no código foram corrigidas para usar o dispositivo ativo em vez disso.

Desempenho e Requisitos

No M4 Pro (24 GB), gera malhas com cerca de 400 mil vértices a partir de fotos únicas em aproximadamente 3,5 minutos. O uso de memória atinge picos de cerca de 18 GB de memória unificada durante a geração.

Requisitos:

  • macOS no Apple Silicon (M1 ou posterior)
  • Python 3.11+
  • 24 GB+ de memória unificada recomendado
  • ~15 GB de espaço em disco para os pesos do modelo
Ad

Configuração e Uso

Início rápido:

git clone https://github.com/shivampkumar/trellis-mac.git
cd trellis-mac
hf auth login
bash setup.sh
source .venv/bin/activate
python generate.py caminho/para/imagem.png

Você precisa solicitar acesso aos modelos com acesso controlado no HuggingFace: facebook/dinov3-vitl16-pretrain-lvd1689m e briaai/RMBG-2.0.

Uso básico:

python generate.py foto.png
python generate.py foto.png --seed 123 --output meu_modelo --pipeline-type 512

Limitações

  • Não há exportação de texturas (as malhas são exportadas apenas com cores de vértice)
  • Preenchimento de buracos desativado (as malhas podem ter pequenos buracos)
  • Mais lento que o CUDA (~10x mais lento para convolução esparsa)
  • Apenas inferência, sem suporte a treinamento

Implementação Técnica

A convolução 3D esparsa constrói um hash espacial de voxels ativos, coleta características de vizinhos para cada posição do kernel, aplica pesos via multiplicação de matrizes e espalha-adiciona os resultados de volta. A extração de malha reimplementa flexible_dual_grid_to_mesh usando dicionários Python em vez de operações de hashmap do CUDA.

Benchmarks no M4 Pro (24 GB), tipo de pipeline 512:

  • Carregamento do modelo: ~45s
  • Pré-processamento da imagem: ~5s
  • Amostragem da estrutura esparsa: ~15s
  • Amostragem Shape SLat: ~90s
  • Amostragem Texture SLat: ~50s
  • Decodificação da malha: ~30s
  • Total: ~3,5 min

📖 Leia a fonte completa: HN LLM Tools

Ad

👀 See Also

Zoku: Uma Ferramenta que Detecta Automaticamente Fluxos de Trabalho Repetidos no Código Claude
Tools

Zoku: Uma Ferramenta que Detecta Automaticamente Fluxos de Trabalho Repetidos no Código Claude

Zoku é uma ferramenta local que se conecta ao sistema de eventos do Claude Code para registrar ações de ferramentas entre sessões, identifica padrões repetidos de fluxo de trabalho e, em seguida, informa o Claude sobre esses padrões para que ele possa sugerir ou executá-los proativamente. Não requer configuração, não tem dependências e armazena tudo localmente em ~/.zoku/.

OpenClawRadar
MAGELLAN: Um Sistema Autônomo de Descoberta Científica com 15 Agentes Baseado no Claude Code
Tools

MAGELLAN: Um Sistema Autônomo de Descoberta Científica com 15 Agentes Baseado no Claude Code

MAGELLAN é um sistema autônomo de descoberta científica com 15 agentes, construído inteiramente no Claude Code. Ele usa o Opus para raciocínio profundo e o Sonnet para tarefas estruturadas, gerando hipóteses interdisciplinares sem direção humana, com 260 hipóteses propostas e 60% eliminadas por validação adversária em 19 sessões.

OpenClawRadar
Kreuzberg v4.7.0 adiciona inteligência de código para 248 idiomas e extração aprimorada de markdown
Tools

Kreuzberg v4.7.0 adiciona inteligência de código para 248 idiomas e extração aprimorada de markdown

Kreuzberg v4.7.0, uma biblioteca de inteligência de documentos com núcleo em Rust, agora suporta extração de código para 248 formatos via tree-sitter e melhorou significativamente a qualidade do markdown com pontuações Structural F1 acima de 80% em 23 formatos.

OpenClawRadar
🦀
Tools

Cocall.ai MCP: Chamadas Telefônicas de Saída com Encaminhamento para Humano em Tempo Real

Cocall.ai é um MCP para Claude que permite fazer chamadas telefônicas de saída com um modelo de fala para fala full-duplex. Ele pode pausar uma chamada no meio para fazer uma pergunta específica em vez de adivinhar, navegar por menus IVR e transferir chamadas para você quando necessário.

OpenClawRadar