Pipeline local de INEMA: transcribe el video de origen, reescribe el guion en PT-BR, genera las imágenes en inemaimg, anima los ganchos en Agnes, narra en inemavox, renderiza en HyperFrames y entrega por Telegram.

El primer caso fue el video «GPT-6 Astra Doesn't Need Your Instructions Anymore», de Nate B. Jones (06/09/2026). Se produjeron un video completo en dos formatos y tres reels, todos con CTA de INEMA.CLUB y crédito al análisis original.
Transcripción limpia con marcas de tiempo, tesis, capítulos y los 8 puntos del video fuente. El guion nace de ahí, no de un resumen genérico.
47 escenas generadas en flux2-klein en 1344×768 (16:9) y 768×1344 (9:16). Nada de recortar el formato horizontal para convertirlo en vertical.
Las escenas de apertura se convierten en clips image-to-video en Agnes (keyframes A→B). El resto recibe Ken Burns y crossfade en HyperFrames.
Versiones web (comprimidas). Los masters en alta calidad están en la carpeta de salida local. Basado en el análisis de Nate B. Jones.
"La AGI llegó" no por un benchmark, sino porque pasamos el punto de darle el método a la máquina. El detonante es GPT-6 Astra, el primer "súper agente": razona en distintos trabajos, ve la pantalla, usa software, se recupera de los errores, guarda contexto durante días y decide sin preguntar.
Todo se ejecuta localmente en la máquina INEMA. Un único archivo de guion (scripts/roteiro.json) alimenta la narración, el texto en pantalla y la composición, y la duración real de cada WAV controla el timing.
A pantalla completa con Ken Burns y crossfade real (tracks alternados 5/6). Un scrim permanente garantiza la lectura del texto.
Video de Agnes de 8 s sobre la imagen en las escenas de gancho, con fundido hacia la imagen fija. Wrapper animado, nunca el <video>.
Kicker, título Sora con destaque ámbar, listas con stagger, contador, número grande en los reels de lista. Safe zones en 9:16.
Servicios locales del ecosistema INEMA. Sin clave de API paga.
Servidor de imágenes (flux2-klein) en el puerto 8000.
curl -s localhost:8000/healthTTS local. La voz rachel funciona mediante tts_direct.py con engine chatterbox-vc.
ls ~/projetos/timesmkt3/media/voice-refs/rachel.wavNode 22+, ffmpeg, Chrome headless; clave Agnes en agnes-nei/.env.
npx hyperframes doctorTrabaja en ~/projetos/output/<nome>/. Los comandos de abajo son los del repositorio.
La skill /watch descarga, extrae fotogramas y captura los subtítulos. La transcripción limpia se convierte en la base del análisis.
python3 watch.py "https://www.youtube.com/watch?v=..." --detail balanced --max-frames 40
Cada escena tiene img, kicker, tela (HTML breve) y fala (forma hablada, números escritos con letras). Después genera los txt de narración.
python3 tools/escrever_txt.py # roteiro.json → <vídeo>/assets/txt/sN.txt + SCRIPT.md
Prompts en inglés, en prosa, sin texto en la imagen. Idempotente: borra un PNG para volver a generarlo con otra seed.
python3 tools/prompts.py && python3 tools/gen_img.py img/prompts.json img
Un clip de 8 s por video, keyframes A→B (B es A con dolly-in mediante ffmpeg). Límite real: 6 solicitudes por minuto.
python3 tools/agnes_clip.py clips/jobs.json
Ejecuta el tts_direct.py de inemavox en su propio scope y mide la duración y el volumen de cada WAV (el fallo se muestra claramente si queda en silencio).
python3 tools/narrar_vc.py principal # idem reel1 reel2 reel3
O build.mjs escribe el index.html de HyperFrames; el render.sh espera la narración, ejecuta lint y renderiza en alta calidad.
node build.mjs --video principal --vertical bash scripts/render.sh principal reel1 reel2 reel3
El texto y los videos se envían a @inemav3bot. Si superan los 49 MB, envía una copia comprimida y conserva intacto el master.
python3 tools/enviar.py video reel1/reel1-9x16.mp4 "legenda" 1080x1920
Prosa descriptiva, luz ámbar y teal, sin texto. Las 47 se generaron en unos 6 s cada una con flux2-klein.




Lo que ya existe y lo que falta para convertirse en una fábrica.