Un mapa de ~45 proyectos que producen o procesan video e imagen: render determinístico, generación con IA local y en la nube, dirección, orquestadores y soporte de imagen, voz y música — cada uno con lo que hace, cómo ejecutarlo y el enlace a su guía.
Esta página reúne herramientas que evolucionaron en paralelo. La idea es dejar de redescubrir «qué proyecto hace X»: aquí encuentras el camino adecuado en segundos y vas directamente a la guía.
Determinista, IA en la nube, IA local, imagen, dirección, orquestación y posproducción. Cada solicitud de video va por uno de ellos.
La mayoría se ejecuta en tu máquina/DGX: flux2-klein (imagen), inemavox (voz), HyperFrames/Remotion/pixflow (render). La IA de video local es opcional.
Los orquestadores reutilizan los mismos componentes: dirección de MDD, imagen de inemaimg, voz de inemavox y render de HyperFrames.
Antes de escribir un pipeline nuevo, mira lo que ya se midió. Estos cinco resolvieron el problema y dejaron notas, incluso sobre los defectos.
Estándar de oro para cuentos animados: anclas de personajes derivadas (no generadas en paralelo), descripción del personaje repetida en cada escena, narración por párrafo, sin texto en pantalla. Salidas en ~/projetos/output/videos-agnes/.
NOTAS-API.md incluye las reglas que generan dinero, los defectos del modelo y los rate limits. Incluye la trampa del filtro: el personaje niño devuelve HTTP 400 de forma determinista.
Acceso vía MCP y CLI, con cuenta, valores predeterminados y doblaje con voz clonada. Notas de API medidas en ~/projetos/wifi/KLING-NOTAS-API-2026-08-02.md.
Parallax 2.5D con profundidad real, grain, LUT y viñeta. Determinístico: misma entrada, mismo resultado — lo opuesto a un generador de video.
Un mismo personaje aparece en folder, cómic, motion comic y toda una serie, manteniendo la consistencia visual.
Empieza por el tipo de video que quieres. El flujo de abajo te indica el camino; el catálogo detalla cada pieza.
Cámara/parallax sobre imágenes, motion graphics, cómic animado. → pixflow, inemafilme, inemaref, HyperFrames, Remotion.
Cuento, episodio, personaje coherente. → videos-agnes (simple, US$ 0) o videoanima (con edición y proveedor intercambiable).
En la nube/suscripción: klingaimcp, seedance2. Local en la GPU: VideosDGX2 (Wan 2.2), HuMo, skyreelsv3.
Avatar parlante con guion. → heygenmcp (créditos de la suscripción), videosavatar, o HuMo para lip-sync local.
Explicativo, demo de app, video educativo, reels de marketing. → videoproductor, video-explicativo, video-demonstrativo, videos-cursos-inema, timesmkt3.
Doblar, eliminar muletillas, subtitular, cambiar la pista. → dublar pro, inemavox, musicaclone, inemadlp.
Cada tarjeta: qué hace, entrada→salida/cómo ejecutarlo y el enlace. Cuando hay una página publicada, el enlace lleva a guía; si no, al repo. El punto de color indica el estado; (local) = sin remoto en GitHub.
Película cinematográfica a partir de imágenes estáticas: parallax con profundidad real + grain/LUT/vineta/bloom, cámara y transiciones.
YAML (movie spec) + imágenes → MP4 16:9. Depth-Anything-V2 + WebGL/GLSL + Remotion + FFmpeg.
repo ↗Guion estructurado (historia.json) se convierte en una película narrada en parallax sobre el motor pixflow — cámara elegida según la emoción, música y SFX.
historia.json → MP4. No escribe la historia: eso es la skill roteiro.
Fábrica narrativa: folder de personaje → cómic → motion-comic y serie completa a partir de un tema.
JSON (biblia + guion) + referencias → MP4 en las Formas A (presentación de diapositivas), B (viaje de cámara) y C (dirigida). Python + Chrome headless + TTS + FFmpeg.
guía ↗Motor base de casi todas las skills: anima HTML+GSAP y graba mediante Chrome headless. cchyperframes = editor.
HTML + narración TTS → MP4 16:9/9:16. Node + Playwright + Kokoro + FFmpeg.
cchyperframes ↗ · skill ↗Framework de video en React (capa de texto cinético/datos). remotion-templates = 81 componentes listos.
TSX + medios → MP4/WebM/GIF mediante FFmpeg.
remotion ↗ · templates ↗Toda la página es un único plano cinematográfico que avanza a medida que el visitante se desplaza. Código puro (GSAP) o footage de un generador.
tema/footage → sitio scroll-film. No es una presentación de diapositivas ni un sitio institucional.
guía ↗Servidor MCP (119 tools, guardrailed) para que los agentes editen video: corte, merge, crop, overlays, subtítulos, efectos.
specs JSON → video editado + análisis. Python 3.11 + FFmpeg + HyperFrames.
guía ↗Historia → desglose cinematográfico → keyframes A/B → clips → película vertical narrada. Mide el movimiento de cada clip y vuelve a hacer los que quedan estáticos. En ajuste: consulta el post-mortem en el repo.
desglose de planos YAML → MP4 9:16. Proveedor de imágenes y videos intercambiable mediante parámetro (agnes/inemaimg/kie · agnes/kling/klingai/kie).
guía ↗Historia/cuento → película animada narrada mediante Agnes AI, entregada en Telegram. El camino simple: sin desglose, sin elegir proveedor.
historia → model sheet + 2 imágenes/escena + clips + narración local → MP4.
guía ↗Kling AI mediante MCP y CLI con la suscripción propia (Pro/SVIP) — incluye doblaje con voz clonada. Notas de API medidas.
imagen/prompt → clip. Acepta una ruta local por CLI; vía fal.ai exige un keyframe en una URL pública.
guía ↗Avatar parlante en HeyGen gastando los créditos de la suscripción (vía MCP), no el wallet de API.
guion → MP4 9:16. La hermana heygen-cli hace lo mismo mediante la API key (se paga aparte).
Guion → avatar parlante en HeyGen, con los looks/personajes configurados de la cuenta.
texto → MP4 9:16, voz PT-BR, engine avatar_iii.
guía ↗Una foto se convierte en una maqueta dentro de un rig de efectos prácticos de estudio, y la simulación destruye la maqueta en un único plano detrás de cámaras.
foto → video detrás de cámaras. Recetas medidas para Kling y Agnes.
guía ↗Foto de interior terminado → video time-lapse de reforma: genera el «antes de la obra» con la misma cámara y arquitectura, y el video del antes→después.
1 foto → MP4 de antes y después. GPT Image + Higgsfield Seedance.
guía ↗Genera el prompt cinematográfico estructurado para Seedance 2.0; la generación se ejecuta en FAL.ai. seedance2en es la variante PT/EN.
descripción → prompt de 300–450 palabras + enlace de generación.
repo ↗T2V + I2V local en el DGX Spark con Wan 2.2 (14B MoE y 5B rápido), mediante ComfyUI + web UI.
texto/imagen → MP4. UI en el puerto :7862. Pesos ~25–90GB VRAM.
guía ↗Video centrado en personas y guiado por audio (lip-sync preciso) con HuMo 17B/1.7B. Es la alternativa local al avatar en la nube.
texto + audio (+ imagen) → 480/720p. GPU 32G+. Compatibilidad con ComfyUI.
(local — sin remoto)Interfaz web completa de SkyReels V3: reference-to-video, video-to-video y avatar parlante, con cola de jobs.
texto/imagen/audio → video. PyTorch + diffusers + FastAPI.
guía ↗App de escritorio (Electron) con 4 estudios — imagen, video, lip sync y cine — que integra más de 200 modelos.
variado → video/imagen. macOS/Windows/Linux.
repo ↗Servidor de imágenes con hot-swap de modelos: flux2-klein (predeterminado del ecosistema), Qwen-Edit, FLUX.2-dev, ERNIE. Sin filtro de contenido, acepta referencias nativas, tiene seed.
prompt (+1–4 refs) → PNG. API HTTP en localhost:8000. ~31 s/imagen en el DGX.
Imagen individual mediante Agnes (agnes-image-2.1-flash), sin costo. CLI gerar.py. Atención al filtro: si es un niño, devuelve HTTP 400.
prompt (+refs) → PNG. Compañera de videos-agnes.
La API Agnes analizada en detalle en ~70 llamadas: texto, imagen y video. Las reglas que generan dinero, los defectos del modelo y los rate limits.
documentación medida — léela antes de escribir una integración nueva.
guía ↗Upscale de imagen con IA (Real-ESRGAN, 2x/4x) — útil para refinar cuadros antes del render.
imagen de baja resolución → imagen 2x/4x. App Electron.
repo ↗Motor de prompts KairoBoost (dirección de arte) + caso end-to-end (stills → video 9:16 con narración).
intención + preset → prompt refinado → inemaimg + HyperFrames.
repo ↗Maestro de Dirección Dinámica: transforma un tema en un paquete de dirección (escena, cámara, continuidad) para generadores de IA.
tema → storyboard de paneles + prompt final y negativo p/ Seedance/Kling/Veo/Runway.
guía ↗Dirección de cámara (18 movimientos, reglas validadas A/B) sobre imágenes + narración.
imágenes + narración → desglose JSON + YAML pixflow → MP4.
guía ↗Genera un plan de edición independiente del motor (Viral5 / Hero / Save-the-Cat), con paquete Python vpe.
tema + preset → plano-edicao.json + RESUMO → render mediante HyperFrames.
guía ↗Motor de filmmaking local-first dirigido por knowledge packs (concepto probado en el caso Hormozi-12).
tema → imágenes (flux2) + narración (inemavox) + parallax (pixflow).
guía ↗Línea de producción completa: plan → dirección + imagen → voz → render en 3 capas (cine + texto + ilustración).
enlace/fuente → MP4 profesional 16:9 + 9:16. Reutiliza mdd, flux2, inemavox, HyperFrames, Remotion.
guía ↗Video educativo narrado en PT-BR, desde el guion hasta la CTA INEMA.CLUB. Motion graphics — no muestra una app real.
tema → escenas → TTS local → HTML/GSAP → HyperFrames → MP4 16:9 + 9:16.
guía ↗Recorrido automático por una aplicación web: navega por la app de verdad, captura las pantallas reales y las narra, con cursor animado y zoom.
enlace → captura de UI → narración → MP4 16:9 + 9:16.
guía ↗Genera los videos de un curso INEMA en 3 niveles seleccionables: landing, rutas y clase profunda por módulo/día.
sitio del curso → guion → inemavox → HyperFrames → MP4.
repo ↗Reels promocionales para 12 públicos, con puerta humana en el medio: el bot escribe los textos y se detiene hasta que tú los apruebes.
catálogo de públicos → textos → avatar → reel 9:16.
guía ↗La misma idea, tres videos para distintos públicos en vez de uno: alcance, autoridad y promocional. Sistema separado, con motor y plantillas propios.
/aprovar C#N habilita avatar, descarga y reel.
Encola (FIFO) y ejecuta en segundo plano los renders de las skills de arriba, con notificaciones y panel. Serializa la GPU.
comando (CLI/Telegram) → enqueue → worker → MP4 + aviso.
repo ↗Equipo de agentes de marketing: genera reels/ads (Remotion nativo, quick) y delega los proyectos originales largos a mkvideos. Canónico de la familia timesmkt/2/3, imkt4/5.
/campaña → 5 etapas → imagen (inemaimg) + voz (chatterbox) + video → publica.
guía ↗Suite de voz GPU-first: clonación zero-shot (Chatterbox) + transcripción (Whisper) + doblaje + búsqueda de música y SFX (Pixabay/Freesound).
texto/URL → wav/video doblado. Daemon FastAPI :8010. Voz predeterminada del ecosistema: rachel.
La misma suite sin GPU: Groq Whisper + Edge TTS. Para VPS/laptop.
texto/URL → audio/subtítulos/clips.
repo ↗Biblioteca de código abierto para clonación de voz zero-shot (23 idiomas). Base de inemavox.
texto + ref 10s → wav. pip install chatterbox-tts.
Banda sonora para los videos — clonación/generación de música, para no depender solo de un catálogo.
referencia/prompt → pista de audio.
guía ↗Descargador del ecosistema (yt-dlp): de dónde vienen la música, el ambiente y los SFX cuando un video necesita audio.
URL → audio/video local.
guía ↗Doblaje + edición + transcripción con interfaz web. Varios ASR/TTS/LLM. Canónico — dublar/2/4 están superados.
video → video doblado. FastAPI + Next. Repo: dublarv5.
TTS PT-BR local integrado en las skills de HyperFrames (voces pf_dora / bella / rachel). Alternativa ligera a inemavox.
texto → wav, dentro del pipeline de las skills.
(dentro de las skills)Edición inteligente: elimina muletillas (umm/uh), corrección de color, subtítulos y overlays mediante LLM→EDL.
raw footage → video montado. FFmpeg + LLM + render.
repo ↗Las rutas local-first dependen de algunos servicios y binarios. Inicia los que use tu ruta.
Servidor flux2-klein y compañía.
# inicia el servidor de imagen cd ~/projetos/inemaimg docker compose up # :8000
Narración / clonación / SFX.
# daemon de voz cd ~/projetos/inemavox uvicorn app:api # :8010
Node + FFmpeg + Chrome (HyperFrames).
# verificación rápida node -v && ffmpeg -version echo $CHROMIUM_BIN
Ejemplo del recorrido más común: un tema se convierte en un video profesional reutilizando los componentes. Cambia la skill según el tipo (explicativo, demo, serie, marketing).
Los orquestadores llaman a esos servicios; mantenlos en línea.
cd ~/projetos/inemaimg && docker compose up -d # imagen :8000 cd ~/projetos/inemavox && uvicorn app:api & # voz :8010
Explicativo → video-explicativo. Demo de app → video-demonstrativo. Pro/landing → videoprodutor. Historia → videos-agnes o videoanima. Serie/HQ → inemaref.
# cada skill responde a ayuda /video-explicativo "o que é engenharia de contexto"
En las rutas con proveedor pago, revisa el ritmo y el costo antes de la primera llamada.
python3 rodar.py exemplo --so-decupagem # videoanima: valida sin generar
Para lotes, ponlos en cola en mkivideos y sigue con lo tuyo: serializa la GPU y te avisa al terminar.
/mkivideos explicativo "tema" # encola y renderiza en segundo plano
El resultado se guarda en la carpeta de output predeterminada; mueve el archivo final al destino.
ls ~/projetos/output/<projeto>/ # mp4 16:9 y/o 9:16
Varios proyectos tienen variantes. Usa los canónicos; archiva o elimina el resto.
ivox2 es solo investigación — desechable.skyreels, humo2, HuMo_clean, HuMo_velho. VideosDGX es la generación anterior de DGX2.videosanimados e mkvideos son motores más antiguos de la misma familia.dublar, dublar2, dublar4 son versiones antiguas.timesmkt/timesmkt2 superados; imkt4 duplicado; imkt5 = nueva arquitectura (todavía sin generador de video).*-video no son herramientasagentic-video, aiosagi-video, consultoria2k-video, hermes21c-video, mapacliente-video, my-video, opus48-video, polyskills-video, segrobot-video, uany-video, vla-video y compañía son composiciones HyperFrames de una sola pieza — no busques motor allí.