TRELLIS.2 이미지-3D 변환 기술, Apple Silicon에서 네이티브 실행으로 이식

✍️ OpenClawRadar📅 게시일: April 20, 2026🔗 Source
TRELLIS.2 이미지-3D 변환 기술, Apple Silicon에서 네이티브 실행으로 이식
Ad

이것이 무엇인가요

Microsoft의 TRELLIS.2 이미지-3D 모델을 PyTorch MPS를 통해 Apple Silicon에서 네이티브로 실행되도록 포팅한 버전으로, CUDA 전용 의존성을 순수 PyTorch 대안으로 대체했습니다.

주요 세부사항

원본 TRELLIS.2는 Mac에서 작동하지 않는 flash_attn, nvdiffrast 및 맞춤형 희소 컨볼루션 커널을 포함한 CUDA가 필요합니다. 이 포트는 다음으로 대체합니다:

  • 수집-분산 희소 3D 컨볼루션 구현 (backends/conv_none.py)
  • PyTorch의 scaled_dot_product_attention을 사용한 희소 트랜스포머용 SDPA 어텐션
  • CUDA 해시맵 연산 대신 Python 기반 메시 추출 (backends/mesh_extract.py)

총 변경 사항은 9개 파일에 걸쳐 수백 줄입니다. 모든 하드코딩된 .cuda() 호출은 활성 장치를 사용하도록 패치되었습니다.

성능 및 요구사항

M4 Pro(24GB)에서 단일 사진으로 약 40만 개 정점 메시를 약 3.5분 만에 생성합니다. 생성 중 메모리 사용량은 통합 메모리 약 18GB까지 최고치에 도달합니다.

요구사항:

  • Apple Silicon의 macOS (M1 이상)
  • Python 3.11 이상
  • 24GB 이상 통합 메모리 권장
  • 모델 가중치용 약 15GB 디스크 공간
Ad

설정 및 사용법

빠른 시작:

git clone https://github.com/shivampkumar/trellis-mac.git
cd trellis-mac
hf auth login
bash setup.sh
source .venv/bin/activate
python generate.py path/to/image.png

HuggingFace의 gated 모델에 대한 액세스를 요청해야 합니다: facebook/dinov3-vitl16-pretrain-lvd1689m 및 briaai/RMBG-2.0.

기본 사용법:

python generate.py photo.png
python generate.py photo.png --seed 123 --output my_model --pipeline-type 512

제한사항

  • 텍스처 내보내기 없음 (메시는 정점 색상만으로 내보내짐)
  • 구멍 채우기 비활성화 (메시에 작은 구멍이 있을 수 있음)
  • CUDA보다 느림 (희소 컨볼루션의 경우 약 10배 느림)
  • 추론 전용, 학습 지원 없음

기술 구현

희소 3D 컨볼루션은 활성 복셀의 공간 해시를 구축하고, 각 커널 위치에 대한 이웃 특징을 수집하며, 행렬 곱셈을 통해 가중치를 적용하고, 결과를 다시 분산-추가합니다. 메시 추출은 CUDA 해시맵 연산 대신 Python 딕셔너리를 사용하여 flexible_dual_grid_to_mesh를 재구현합니다.

M4 Pro(24GB), 파이프라인 유형 512 기준 벤치마크:

  • 모델 로딩: 약 45초
  • 이미지 전처리: 약 5초
  • 희소 구조 샘플링: 약 15초
  • Shape SLat 샘플링: 약 90초
  • Texture SLat 샘플링: 약 50초
  • 메시 디코딩: 약 30초
  • 총합: 약 3.5분

📖 전체 소스 읽기: HN LLM Tools

Ad

👀 See Also

엔그램: Claude Code 및 MCP 클라이언트를 위한 오픈소스 메모리 레이어
Tools

엔그램: Claude Code 및 MCP 클라이언트를 위한 오픈소스 메모리 레이어

엔그램은 Claude Code, Cursor, Windsurf와 같은 클라이언트와 함께 MCP 서버로 작동하는 오픈소스 메모리 레이어입니다. 의미론적 벡터 검색으로 무제한 메모리를 저장하며, LOCOMO 벤치마크에서 80% 정확도를 달성하고, 파일 기반 접근법의 5,000개 이상 대비 쿼리당 약 800개의 토큰을 사용합니다.

OpenClawRadar
StartClaw: Claude 통합이 가능한 ZeroClaw 기반의 헤드리스 브라우저 자동화 도구
Tools

StartClaw: Claude 통합이 가능한 ZeroClaw 기반의 헤드리스 브라우저 자동화 도구

StartClaw는 ZeroClaw의 Rust 기반과 Composio v3 통합을 기반으로 구축된 브라우저 자동화 도구로, 로컬 하드웨어 없이 클라우드에서 헤드리스로 실행되도록 설계되었습니다. 안정성을 위해 Claude만을 사용하며, 토큰 사용량을 약 5배 줄이는 내장 컨텍스트 압축 기능을 포함합니다.

OpenClawRadar
스므리티: 대화 흐름의 일탈을 방지하기 위한 LLM 추론 상태 관리용 Git 스타일 시스템
Tools

스므리티: 대화 흐름의 일탈을 방지하기 위한 LLM 추론 상태 관리용 Git 스타일 시스템

Smriti는 개발자들이 LLM 대화에서 추론 상태를 저장, 복원, 분기 및 비교하여 드리프트를 방지할 수 있도록 하는 오픈소스 도구입니다. 이 도구는 상호작용을 채팅 기록이 아닌 상태로 취급하여 오염 없이 깔끔한 롤백과 대안 탐색을 가능하게 합니다.

OpenClawRadar
구피LM: 교육 목적으로 처음부터 구축된 9백만 파라미터 규모의 대규모 언어 모델
Tools

구피LM: 교육 목적으로 처음부터 구축된 9백만 파라미터 규모의 대규모 언어 모델

GuppyLM은 6개의 레이어, 384개의 은닉 차원, 6개의 어텐션 헤드를 가진 기본 트랜스포머 아키텍처를 사용하여 60K개의 합성 대화로 처음부터 학습된 약 9백만 파라미터 언어 모델입니다. 무료 Colab T4 GPU에서 약 5분 동안 학습하며, 물, 음식, 수조 생활에 초점을 맞춘 물고기 성격으로 말합니다.

OpenClawRadar