Um mapa dos ~45 projetos que produzem ou processam vídeo e imagem: render determinístico, geração por IA local e na nuvem, direção, orquestradores e suporte de imagem, voz e música — cada um com o que faz, como rodar e o link do guia.
Esta página reúne ferramentas que evoluíram em paralelo. A ideia é parar de redescobrir “qual projeto faz X”: aqui você acha o caminho certo em segundos e vai direto pro guia.
Determinístico, IA na nuvem, IA local, imagem, direção, orquestração e pós. Cada pedido de vídeo cai em um deles.
A maioria roda na sua máquina/DGX: flux2-klein (imagem), inemavox (voz), HyperFrames/Remotion/pixflow (render). IA de vídeo local é opcional.
Os orquestradores reusam os mesmos tijolos — direção do MDD, imagem do inemaimg, voz do inemavox, render do HyperFrames.
Antes de escrever pipeline novo, veja o que já foi medido. Estes cinco resolveram o problema e deixaram notas — inclusive dos defeitos.
Padrão-ouro para conto animado: âncoras de personagem derivadas (não geradas em paralelo), descrição do personagem repetida em toda cena, narração por parágrafo, sem texto na tela. Saídas em ~/projetos/output/videos-agnes/.
NOTAS-API.md traz as regras que valem dinheiro, os defeitos do modelo e os rate limits. Inclui a armadilha do filtro: personagem criança devolve HTTP 400 de forma determinística.
Acesso via MCP e CLI, com conta, defaults e dublagem com voz clonada. Notas de API medidas em ~/projetos/wifi/KLING-NOTAS-API-2026-08-02.md.
Parallax 2.5D com profundidade real, grain, LUT e vinheta. Determinístico: mesma entrada, mesmo resultado — o oposto do gerador de vídeo.
Um mesmo personagem atravessa folder, quadrinho, motion comic e série inteira, mantendo consistência visual.
Comece pelo tipo de vídeo que você quer. O fluxo abaixo aponta o caminho; o catálogo tem o detalhe de cada peça.
Câmera/parallax sobre imagens, motion graphics, HQ animada. → pixflow, inemafilme, inemaref, HyperFrames, Remotion.
Conto, episódio, personagem consistente. → videos-agnes (simples, US$ 0) ou videoanima (com decupagem e provedor trocável).
Na nuvem/assinatura: klingaimcp, seedance2. Local na GPU: VideosDGX2 (Wan 2.2), HuMo, skyreelsv3.
Avatar falante de roteiro. → heygenmcp (créditos da assinatura), videosavatar, ou HuMo pra lip-sync local.
Explicativo, demo de app, videoaula, reels de marketing. → videoprodutor, video-explicativo, video-demonstrativo, videos-cursos-inema, timesmkt3.
Dublar, cortar fillers, legendar, trocar a trilha. → dublar pro, inemavox, musicaclone, inemadlp.
Cada card: o que faz, entrada→saída/como rodar, e o link. Onde existe página publicada, o link vai pro guia; senão, pro repo. O ponto colorido indica o status; (local) = sem remote no GitHub.
Filme cinematográfico a partir de imagens estáticas: parallax com profundidade real + grain/LUT/vinheta/bloom, câmera e transições.
YAML (movie spec) + imagens → MP4 16:9. Depth-Anything-V2 + WebGL/GLSL + Remotion + FFmpeg.
repo ↗Roteiro estruturado (historia.json) vira filme narrado em parallax sobre o motor pixflow — câmera escolhida por emoção, música e SFX.
historia.json → MP4. Não escreve a história: isso é a skill roteiro.
Fábrica narrativa: folder de personagem → quadrinho → motion-comic e série inteira a partir de um assunto.
JSON (bíblia + roteiro) + referências → MP4 nas Formas A (slideshow), B (câmera-viagem) e C (dirigida). Python + Chrome headless + TTS + FFmpeg.
guia ↗Motor base de quase todas as skills: anima HTML+GSAP e grava via Chrome headless. cchyperframes = editor.
HTML + narração TTS → MP4 16:9/9:16. Node + Playwright + Kokoro + FFmpeg.
cchyperframes ↗ · skill ↗Framework de vídeo em React (camada de texto cinético/dados). remotion-templates = 81 componentes prontos.
TSX + mídia → MP4/WebM/GIF via FFmpeg.
remotion ↗ · templates ↗A página inteira é um plano cinematográfico único que avança conforme o visitante rola. Código puro (GSAP) ou footage de um gerador.
assunto/footage → site scroll-film. Não é deck de slides nem site institucional.
guia ↗Servidor MCP (119 tools, guardrailed) pra agentes editarem vídeo: corte, merge, crop, overlays, legendas, efeitos.
specs JSON → vídeo editado + análise. Python 3.11 + FFmpeg + HyperFrames.
guia ↗História → decupagem cinematográfica → keyframes A/B → clipes → filme vertical narrado. Mede o movimento de cada clipe e refaz o que sai parado. Em ajuste: ver o post-mortem no repo.
decupagem YAML → MP4 9:16. Provedor de imagem e vídeo trocável por parâmetro (agnes/inemaimg/kie · agnes/kling/klingai/kie).
guia ↗História/conto → filme animado narrado via Agnes AI, entregue no Telegram. O caminho simples: sem decupagem, sem escolher provedor.
história → model sheet + 2 imagens/cena + clipes + narração local → MP4.
guia ↗Kling AI via MCP e CLI com a assinatura própria (Pro/SVIP) — inclui dublagem com voz clonada. Notas de API medidas.
imagem/prompt → clipe. Aceita caminho local pelo CLI; via fal.ai exige keyframe em URL pública.
guia ↗Avatar falante no HeyGen gastando os créditos da assinatura (via MCP), não o wallet de API.
roteiro → MP4 9:16. A irmã heygen-cli faz o mesmo pela API key (pago à parte).
Roteiro → avatar falante no HeyGen, com os looks/personagens configurados da conta.
texto → MP4 9:16, voz PT-BR, engine avatar_iii.
guia ↗Uma foto vira maquete dentro de um rig de efeitos práticos de estúdio, e a simulação destrói a maquete em plano único de bastidores.
foto → vídeo behind-the-scenes. Receitas medidas para Kling e Agnes.
guia ↗Foto de interior finalizado → vídeo time-lapse de reforma: gera o “antes da obra” com a mesma câmera e arquitetura, e o vídeo antes→depois.
1 foto → MP4 antes/depois. GPT Image + Higgsfield Seedance.
guia ↗Gera o prompt cinematográfico estruturado pro Seedance 2.0; a geração roda em FAL.ai. seedance2en é a variante PT/EN.
descrição → prompt 300–450 palavras + link de geração.
repo ↗T2V + I2V local no DGX Spark com Wan 2.2 (14B MoE e 5B rápido), via ComfyUI + web UI.
texto/imagem → MP4. UI na porta :7862. Pesos ~25–90GB VRAM.
guia ↗Vídeo humano-cêntrico audio-driven (lip-sync fino) com HuMo 17B/1.7B. É a alternativa local ao avatar de nuvem.
texto + áudio (+ imagem) → 480/720p. GPU 32G+. Suporte ComfyUI.
(local — sem remote)Web UI completa do SkyReels V3: reference-to-video, video-to-video e talking avatar, com fila de jobs.
texto/imagem/áudio → vídeo. PyTorch + diffusers + FastAPI.
guia ↗App desktop (Electron) com 4 estúdios — imagem, vídeo, lip sync e cinema — agregando 200+ modelos.
variado → vídeo/imagem. macOS/Windows/Linux.
repo ↗Servidor de imagem com hot-swap de modelos: flux2-klein (default do ecossistema), Qwen-Edit, FLUX.2-dev, ERNIE. Sem filtro de conteúdo, aceita refs nativas, tem seed.
prompt (+1–4 refs) → PNG. API HTTP em localhost:8000. ~31s/imagem no DGX.
Imagem avulsa via Agnes (agnes-image-2.1-flash), sem custo. CLI gerar.py. Atenção ao filtro: criança devolve HTTP 400.
prompt (+refs) → PNG. Companheira do videos-agnes.
A API Agnes dissecada em ~70 chamadas: texto, imagem e vídeo. As regras que valem dinheiro, os defeitos do modelo e os rate limits.
documentação medida — leia antes de escrever integração nova.
guia ↗Upscale de imagem por IA (Real-ESRGAN, 2x/4x) — útil pra refinar quadros antes do render.
imagem baixa → imagem 2x/4x. App Electron.
repo ↗Motor de prompts KairoBoost (direção de arte) + case end-to-end (stills → vídeo 9:16 com narração).
intenção + preset → prompt refinado → inemaimg + HyperFrames.
repo ↗Mestre de Direção Dinâmica: transforma um assunto em pacote de direção (cena, câmera, continuidade) pra geradores IA.
assunto → storyboard de painéis + prompt final e negativo p/ Seedance/Kling/Veo/Runway.
guia ↗Direção de câmera (18 movimentos, regras validadas A/B) sobre imagens + narração.
imagens + narração → decupagem JSON + YAML pixflow → MP4.
guia ↗Gera plano de edição agnóstico de motor (Viral5 / Hero / Save-the-Cat), com pacote Python vpe.
assunto + preset → plano-edicao.json + RESUMO → render via HyperFrames.
guia ↗Engine de filmmaking local-first dirigida por knowledge packs (conceito provado no case Hormozi-12).
assunto → imagens (flux2) + narração (inemavox) + parallax (pixflow).
guia ↗Linha de montagem completa: plano → direção + imagem → voz → render em 3 camadas (cinema + texto + ilustração).
link/fonte → MP4 profissional 16:9 + 9:16. Reusa mdd, flux2, inemavox, HyperFrames, Remotion.
guia ↗Vídeo educativo narrado PT-BR, do roteiro à CTA INEMA.CLUB. Motion graphics — não mostra app real.
assunto → cenas → TTS local → HTML/GSAP → HyperFrames → MP4 16:9 + 9:16.
guia ↗Walkthrough automático de um web app: navega o app de verdade, captura as telas reais e narra, com cursor animado e zoom.
link → captura UI → narração → MP4 16:9 + 9:16.
guia ↗Gera os vídeos de um curso INEMA em 3 níveis selecionáveis: landing, trilhas e aula profunda por módulo/dia.
site do curso → roteiro → inemavox → HyperFrames → MP4.
repo ↗Reels de divulgação para 12 públicos, com portão humano no meio: o bot escreve os textos e para até você aprovar.
catálogo de públicos → textos → avatar → reel 9:16.
guia ↗Mesma ideia, três vídeos por público em vez de um: alcance, autoridade e promocional. Sistema separado, com motor e templates próprios.
/aprovar C#N libera avatar, download e reel.
Enfileira (FIFO) e executa os renders das skills acima em background, com notificação e painel. Serializa a GPU.
comando (CLI/Telegram) → enqueue → worker → MP4 + aviso.
repo ↗Time de agentes de marketing: gera reels/ads (Remotion nativo, quick) e delega autorais longos pro mkvideos. Canônico da família timesmkt/2/3, imkt4/5.
/campanha → 5 stages → imagem (inemaimg) + voz (chatterbox) + vídeo → publica.
guia ↗Suite de voz GPU-first: clonagem zero-shot (Chatterbox) + transcrição (Whisper) + dublagem + busca de música e SFX (Pixabay/Freesound).
texto/URL → wav/vídeo dublado. Daemon FastAPI :8010. Voz default do ecossistema: rachel.
Mesma suite sem GPU: Groq Whisper + Edge TTS. Pra VPS/laptop.
texto/URL → áudio/legendas/clips.
repo ↗Biblioteca open-source de clonagem de voz zero-shot (23 idiomas). Base do inemavox.
texto + ref 10s → wav. pip install chatterbox-tts.
Trilha para os vídeos — clonagem/geração de música, pra não depender só de acervo.
referência/prompt → faixa de áudio.
guia ↗Downloader do ecossistema (yt-dlp): de onde vêm música, ambiência e SFX quando um vídeo precisa de áudio.
URL → áudio/vídeo local.
guia ↗Dublagem + corte + transcrição com interface web. Múltiplos ASR/TTS/LLM. Canônico — dublar/2/4 são superados.
vídeo → vídeo dublado. FastAPI + Next. Repo: dublarv5.
TTS PT-BR local embutido nas skills HyperFrames (vozes pf_dora / bella / rachel). Alternativa leve ao inemavox.
texto → wav, dentro do pipeline das skills.
(dentro das skills)Corte inteligente: remove fillers (umm/uh), color grade, legendas e overlays via LLM→EDL.
raw footage → vídeo montado. FFmpeg + LLM + render.
repo ↗Os caminhos local-first dependem de alguns serviços e binários. Suba o que o seu caminho usa.
Servidor flux2-klein e cia.
# sobe o server de imagem cd ~/projetos/inemaimg docker compose up # :8000
Narração / clonagem / SFX.
# daemon de voz cd ~/projetos/inemavox uvicorn app:api # :8010
Node + FFmpeg + Chrome (HyperFrames).
# checagem rápida node -v && ffmpeg -version echo $CHROMIUM_BIN
Exemplo do trajeto mais comum: um assunto vira vídeo profissional reusando os tijolos. Troque a skill conforme o tipo (explicativo, demo, série, marketing).
Os orquestradores chamam esses serviços; deixe-os no ar.
cd ~/projetos/inemaimg && docker compose up -d # imagem :8000 cd ~/projetos/inemavox && uvicorn app:api & # voz :8010
Explicativo → video-explicativo. Demo de app → video-demonstrativo. Pro/landing → videoprodutor. História → videos-agnes ou videoanima. Série/HQ → inemaref.
# cada skill responde a help /video-explicativo "o que é engenharia de contexto"
Nos caminhos com provedor pago, confira ritmo e custo antes da primeira chamada.
python3 rodar.py exemplo --so-decupagem # videoanima: valida sem gerar
Para lotes, enfileire no mkivideos e siga a vida — ele serializa a GPU e avisa no fim.
/mkivideos explicativo "tema" # enfileira e renderiza em background
A saída cai na pasta de output padrão; mova o final pro destino.
ls ~/projetos/output/<projeto>/ # mp4 16:9 e/ou 9:16
Vários projetos têm variantes. Use os canônicos; arquive ou remova o resto.
ivox2 é só pesquisa — descartável.skyreels, humo2, HuMo_clean, HuMo_velho. VideosDGX é a geração anterior do DGX2.videosanimados e mkvideos são motores mais antigos da mesma família.dublar, dublar2, dublar4 são versões antigas.timesmkt/timesmkt2 superados; imkt4 duplicado; imkt5 = nova arquitetura (ainda sem gerador de vídeo).*-video não são ferramentasagentic-video, aiosagi-video, consultoria2k-video, hermes21c-video, mapacliente-video, my-video, opus48-video, polyskills-video, segrobot-video, uany-video, vla-video e cia. são composições HyperFrames de uma peça só — não procure motor ali.