Vídeo/IA · DGX Spark

Vídeo por IA 100% local, sem depender de nuvem

Wan 2.2 rodando no NVIDIA DGX Spark via ComfyUI, com interface web própria e fila de jobs — geração de vídeo por texto ou imagem, direto no hardware, sem custo por chamada de API.

Geração de vídeo por IA rodando local no NVIDIA DGX Spark
O que é

Stack de geração de vídeo dedicado ao DGX Spark

Continuação reorganizada do repositório original VideosDGX (mantido como backup histórico) — aqui ficou só o que está ativo em produção: ComfyUI + Wan 2.2.

🖥️ Tudo local

Roda inteiro na GPU Blackwell GB10 do DGX Spark (128 GB de memória unificada, ~1 PFLOP FP4) — sem enviar prompt nem receber vídeo de nenhuma API externa.

🎞️ Wan 2.2 (5B e 14B MoE)

Dois modelos ativos: o 5B rápido (texto-para-vídeo e imagem-para-vídeo) e o 14B MoE dual-expert pra qualidade máxima em T2V.

📋 Fila de jobs

Interface web própria (FastAPI) na porta 7862 com fila, cancelamento, presets por modelo e galeria dos vídeos gerados — além dos geradores em linha de comando.

Como funciona

Do prompt ao vídeo, dentro do próprio DGX

A interface web (ou os scripts CLI) montam o workflow e submetem ao ComfyUI, que roda a inferência na GPU e devolve o vídeo pronto.

Prompt (texto ou imagem) Interface web / CLI Workflow ComfyUI (Wan 2.2) Inferência na GB10 Vídeo na galeria / pasta output

Modelos ativos

ModeloVRAMUso
Wan 2.2 14B MoE~90 GBQualidade máxima (dual-expert), T2V
Wan 2.2 5B~25 GBRápido, T2V + I2V

Endpoints da interface web

EndpointMétodo
/api/generatePOST — enfileira job
/api/jobsGET — fila + progresso
/api/cancel/{job_id}POST — cancela job
/api/all-videosGET — galeria
Pré-requisitos

O que precisa estar no ar

Feito sob medida pro NVIDIA DGX Spark 2026 (GB10 Blackwell, 128 GB unificados). Os pesos dos modelos (~50 GB) não ficam no git.

Ambiente Python

venv comfyui-env com o ComfyUI oficial NVIDIA e as dependências da interface web.

# ativar o venv
source comfyui-env/bin/activate
pip install -r requirements.txt

Pesos dos modelos

Wan 2.2 (14B e 5B) + text encoder UMT5 + VAE em ComfyUI/models/ — baixados à parte, ignorados pelo git.

# passo a passo completo
cat doc/GUIA_COMPLETO_DO_ZERO.md

ComfyUI no ar

Sobe junto com a interface web, ou manualmente antes se preferir.

# manual, se precisar
python3 ComfyUI/main.py --listen 0.0.0.0 --highvram
Guia de uso · passo a passo

Gerando o primeiro vídeo

Dois caminhos: a interface web (fila de jobs, presets, galeria) ou os scripts CLI direto no terminal.

1

Suba a interface web

Sobe o ComfyUI (se não estiver rodando) e a interface web na porta 7862.

./iniciar_interface_web.sh  # http://localhost:7862 (ComfyUI em :8188)
2

Acesse local ou remoto

De outra máquina na rede, descubra o IP do DGX e abra a porta 7862 no firewall se precisar.

hostname -I  # pega o IP do DGX
# depois: http://<IP>:7862
3

Ou gere pela linha de comando — Wan 2.2 5B (T2V)

Rápido, ideal pra iterar em prompts.

python3 gerar_video_wan22_5b.py "um gato astronauta flutuando na ISS" \
  --width 1280 --height 720 --frames 33 --fps 24 --cfg 6.0 --seed -1
4

Qualidade máxima — Wan 2.2 14B MoE (T2V)

Dual-expert, mais lento, resultado superior. Máximo 81 frames (acima disso aparecem artefatos).

python3 gerar_video_wan22_14b.py "cidade cyberpunk à noite, chuva, neon" \
  --width 1280 --height 704 --frames 81 --steps 30 --split-step 15
5

Imagem-para-vídeo — Wan 2.2 5B (I2V)

Anima uma imagem inicial a partir de um prompt de movimento.

python3 gerar_video_wan22_5b_i2v.py "a câmera afasta lentamente" --help
6

Dica de prompt

Fórmula recomendada e restrição de resolução dos modelos Wan 2.2.

# fórmula
[SUJEITO] + [AÇÃO] + [CENÁRIO] + [ESTILO] + [QUALIDADE]
# largura/altura sempre múltiplos de 32
Roadmap

Estado atual e próximo passo opcional

O stack ativo hoje é ComfyUI + Wan 2.2. O LTX-2.3 é um add-on documentado, ainda não instalado por padrão.

v5.0
Reorganização (atual)Stack reduzido a ComfyUI + Wan 2.2 (5B + 14B MoE); pipelines antigos (LTX-2 19B, Wan 2.1, MAGI-1, Waver) e o approach Docker foram removidos; repo original preservado como backup em inematds/VideosDGX.
Opcional
LTX-2.3 (Lightricks, 22B)Vídeo + áudio sincronizados num único modelo, com lipsync nativo e pipeline em 2 estágios. Não vem instalado — add-on documentado no README, requer ~80 GB de download (checkpoint + text encoder Gemma 3 12B gated + upscalers).
v4.2
Interface web: fila + cancelamentoFila ilimitada de jobs, cancelamento em fila ou em processamento, posição na fila via /api/jobs, estado persistido em /tmp/dgx_jobs_v4_2.json.