PTENES
Skill /watch · Claude Code · Codex · claude.ai

Dale ojos a Claude para ver video

Pega una URL o un archivo local. Claude lo descarga, extrae frames por corte de escena, transcribe y responde basándose realmente en lo que visto e escuchado el video.

/watch https://youtu.be/… «¿cuál es el gancho?»
[watch] descargando mediante yt-dlp…
[watch] fotogramas por corte de escena (1 por toma)…
[watch] análisis detallado del hook durante los primeros 10s…
[watch] transcrito mediante Groq whisper-large-v3

# watch: relatório do vídeo
- Frames:  47 @ scene-change
- Hook 0-10s:  pergunta direta + corte rápido
- Transcript:  via captions
- report.md pronto para ingest ✓
Qué es

Claude no tiene entrada de video. Esta skill le da una.

Un script de Python descarga el video, lo convierte en fotogramas JPEG (uno por cada toma detectada), obtiene una transcripción con marcas de tiempo (primero subtítulos, Whisper como alternativa) y se lo entrega todo a Claude Read leer como imagen. Responde mirando lo que está en pantalla y escuchando lo que se dijo.

🎞️ Fotogramas por corte de escena

Un fotograma por cada toma detectada mediante ffmpeg select=gt(scene,…), no un intervalo fijo cada N segundos. El costo de tokens se mantiene estable en videos largos, porque la cantidad de frames está limitada por los cortes, no por la duración.

🔬 Microscopio del hook de 0-10s

Análisis denso a 2 fps + transcripción de Whisper a nivel de palabra durante los primeros 10 segundos — donde todo video gana o pierde la atención. El informe indica qué aparecía en pantalla a medida que se pronunciaba cada palabra.

📝 report.md + Obsidian

Informe de esquema fijo (TL;DR, momentos clave, hook, perfil editorial con motion y movimiento de cámara, citas, entidades, conceptos, transcripción) con marcadores que Claude completa. Guardado automático opcional en tu vault de Obsidian.

Cómo funciona

De la URL a la respuesta, en un pipeline

Solo ffmpeg + yt-dlp + stdlib. Únicamente el audio extraído se envía por la red (Groq/OpenAI), y solo cuando faltan subtítulos y Whisper no está desactivado.

URL o archivo→ yt-dlp descarga→ ffmpeg: fotogramas por escena→ ritmo + movimiento + cámara→ subtítulos / Whisper→ Claude lee cada frame→ respuesta + report.md→ Obsidian (opcional)
Objetivo final

El video se convierte en una nota conectada en tu Obsidian

O /watch no se detiene en la respuesta. El objetivo es convertir el video en un nodo de conocimiento estructurado en tu Second Brain — enmarcado por el por qué viste (el --intent). Lo guarda en dos capas.

📄 report.md (siempre)

Artefacto de esquema fijo en raw/watched/<slug>/ + los hero frames: TL;DR desde la perspectiva del intent, momentos clave, microscopio del hook 0-10s, perfil editorial, citas, entidades como [[wikilinks]], conceptos y la transcripción completa.

🧠 Ingesta en la wiki (con consentimiento)

Si el vault tiene uno CLAUDE.md con una operación Ingest, se ejecuta y guarda/actualiza wiki/entities/ (personas, empresas, herramientas), wiki/concepts/ (frameworks), wiki/sources/ (la página del video) y una línea en el log.md.

El objetivo unificador: el video se convierte en un nodo de primera clase en tu grafo de conocimiento — personas, herramientas y conceptos vinculados mediante [[wikilink]] a las notas que ya tienes. Detalle honesto: el report.md el script lo genera automáticamente; la wiki solo se completa si tu vault define la Ingest op — la skill delega este paso al contrato de tu Second Brain, no incluye una ya preparada.

Requisitos previos

Casi sin configuración para empezar

En el primer /watch el preflight lo revisa todo. En macOS se instala automáticamente con brew; en Linux/Windows imprime los comandos exactos. Los subtítulos cubren la mayoría de los videos públicos gratis — la clave de Whisper solo es necesaria cuando el video no tiene subtítulos.

ffmpeg + yt-dlp

Descarga, extracción de frames y audio. Se instalan en la primera ejecución.

# macOS (automático)
brew install ffmpeg yt-dlp
# Linux
sudo apt install ffmpeg
pipx install yt-dlp

Clave de Whisper (opcional)

Solo para videos sin subtítulos. Groq es la opción preferida (más barato/rápido) u OpenAI.

# ~/.config/watch/.env (chmod 600)
GROQ_API_KEY=…   # console.groq.com/keys
OPENAI_API_KEY=… # platform.openai.com
Guía de uso · paso a paso

Instalar y ver

Comandos reales. En Claude Code es un plugin; en Codex/claude.ai es una skill. Una vez instalado, el flujo es solo /watch <url-ou-arquivo> [pergunta].

1

Instalar en Claude Code

Agrega el marketplace e instala el plugin watch. (Dos comandos separados.)

/plugin marketplace add inematds/claude-watch
/plugin install watch@claude-watch
2

Comprobación previa en la primera ejecución

Instala las dependencias faltantes y crea ~/.config/watch/.env. Idempotente: es seguro volver a ejecutarlo.

python3 "$CLAUDE_PLUGIN_ROOT/scripts/setup.py"
3

Ver un video

URL (YouTube, Vimeo, TikTok, X… todo lo que admite yt-dlp) o ruta local. La pregunta se convierte en el intent del informe.

/watch https://youtu.be/dQw4w9WgXcQ # ¿qué pasa a los 30s?
4

Enfocarse en una sección (más densidad, menos tokens)

--start / --end en SS, MM:SS o HH:MM:SS. La transcripción se filtra para el mismo intervalo.

/watch "$URL" --start 2:15 --end 2:45
5

Guardado automático en Obsidian (opcional)

Indica el vault y report.md se convierte en una entrada conectada. Sin eso, el paso de ingestión se omite en silencio.

export WATCH_VAULT_DIR=/caminho/do/seu/vault
Ejemplos

Para qué lo usan las personas

El mismo video, diferentes lentes — el --intent da forma al TL;DR y a las secciones del informe.

🪝 Analizar contenido ajeno

«¿qué gancho abrió?» — Claude mira los primeros frames, lee la transcripción inicial y desglosa la estructura. Sirve para anuncios creativos, introducciones de podcasts y lanzamientos de la competencia.

🐞 Diagnosticar un bug a partir de un video

Envían una grabación de pantalla rota. /watch bug.mov o que está errado? — encuentra el fotograma donde aparece el problema y describe la causa.

⏩ Resumir video largo

/watch <url> resume isso — estructura, momentos clave, lo que se dijo y se mostró. Más rápido que verlo a 2x.

Hoja de ruta

Versiones y origen

Fork de claude-video de Bradley Bonanno (MIT) — el pipeline de yt-dlp + ffmpeg + Whisper es suyo y funciona sin cambios.

v0.4.1
ActualClasificación de movimiento de cámara por toma (panorámica / inclinación / zoom / estática / cámara en mano) mediante ffmpeg vidstabdetect, sin opencv. Antes: movimiento por shot (signalstats), frames por corte de escena, microscopio del hook 0-10s, report.md y guardado automático en Obsidian.
Base
claude-video (Bradley Bonanno)Descarga con yt-dlp + captions, frames con ffmpeg y fps con ajuste automático, backends Groq/OpenAI Whisper, modo enfocado --start/--end y el hook de SessionStart.
Siguiente
Más métricas y plataformasProporción de talking head (detección opcional de rostros), compatibilidad con más fuentes y mejoras en la operación de ingesta en Second Brain.