TRILHA 2

📥 Coleta do acervo

O mentor só sabe o que você coletou. Esta trilha transforma a lista de fontes do ESCOPO.md em texto conferível: quatro coletores, um subagente por fonte, um manifesto com lacre e um verificador que diz "pronto" com número. No piloto do Nei, isso deu 22 fontes e cerca de 189 mil palavras — e revelou dois bugs reais.

2
Módulos
12
Tópicos
~1h45
Duração
Prático
Nível
0%0 de 12
ESCOPO.mdlista de fontes subagente · vídeo subagente · guia subagente · repo subagente · export raw/ + MANIFESTO.json RELATORIO-FALHAS.md stats.py → exit 0 metas · sha256 · relatório

Como ler: a fase 1 vai da esquerda para a direita. O ESCOPO abre um subagente por fonte (caixas pulsando, em paralelo); o que deu certo vira arquivo no raw com linha no manifesto, o que falhou vira linha no relatório. Só a caixa iluminada decide se acabou. O módulo 2.1 ensina os coletores; o 2.2, o manifesto, as falhas e o "pronto".

Mapa da trilha

Conteúdo detalhado

2.1~50 min

📥 Fontes e coletores

Os tipos de fonte, os quatro coletores do kit e a ordem que poupa tempo e dinheiro: legenda, depois transcritor local, depois exportação manual.

O que é:

A classificação das fontes do ESCOPO (vídeo, página/guia, repositório, exportação) e o coletor que atende cada uma, todos gravando em raw/ com uma linha no manifesto.

Por que aprender:

O mentor não lê a internet na hora de ensinar; ele lê o acervo. Fonte fora do acervo simplesmente não existe para ele.

Conceitos-chave:

Acervo · raw · coletor · manifesto · no piloto, 14 lives + 8 guias.

O que é:

Buscar a legenda que o vídeo já tem com yt-dlp --skip-download, sem baixar o vídeo, antes de pensar em transcrever.

Por que aprender:

No piloto, 13 lives vieram por legenda em 1,6 min (169.937 palavras); uma única live transcrita localmente levou 7,7 min.

Conceitos-chave:

Legenda automática · VTT/SRT · idiomas_legenda · plano A antes do plano B.

O que é:

O campo transcrever_cmd do mentor.config.json: qualquer comando seu, com os marcadores {url} e {saida}, que deixa um .txt/.srt/.vtt na pasta indicada.

Por que aprender:

Vídeo sem legenda não precisa virar perda nem custo: o transcritor local resolve, desde que tenha teto de memória e de tempo.

Conceitos-chave:

Transcritor plugável · placeholders · MemoryMax · timeout_video_s.

O que é:

coletar_web.py extrai o texto da página sem navegação e rodapé; coletar_repo.py junta docs e comentários de topo de um clone raso.

Por que aprender:

Menu e rodapé no acervo viram ruído na wiki. E página com menos de 80 palavras é sinal de paywall ou JavaScript: melhor saber na hora.

Conceitos-chave:

Só http/https · limite de 80 palavras · comentário de topo · guias INEMA de 885 a 1.427 palavras.

O que é:

Usar a exportação oficial da plataforma e entregar o arquivo de texto ao coletar_arquivo.py, com --tipo e --origem.

Por que aprender:

A skill de coleta proíbe API paga sem autorização explícita (serviço + finalidade). O caminho manual mantém custo zero e origem rastreável.

Conceitos-chave:

API paga · autorização explícita · --origem vira o campo url · só arquivos de texto.

O que é:

Um comando pronto por coletor, cada um com objetivo e forma de verificar, todos fechando com python3 tools/stats.py.

Por que aprender:

Rodar à mão uma vez é o jeito de entender o que a skill de coleta vai pedir aos subagentes, e de reconhecer uma saída errada.

Conceitos-chave:

Rodar de novo é seguro ("já coletado") · exit 1 se uma fonte falhou · ok com número de palavras.

Ver Completo
2.2~55 min

🧾 Subagentes, manifesto e falhas

Um subagente por fonte, o manifesto com sha256, o relatório de falhas, as metas do stats.py e os dois bugs reais do piloto que viraram o kit 1.2.

O que é:

A skill /<slug>-coletar dispara um subagente para cada fonte, ao mesmo tempo, e junta só os resultados na sessão principal.

Por que aprender:

Fonte lenta não segura as rápidas e o barulho do download não enche o contexto. Mas o paralelo cobra: todos escrevem no mesmo manifesto.

Conceitos-chave:

Subagente · paralelo · skill · trava de arquivo.

O que é:

A lista oficial do acervo: para cada item, tipo, url, arquivo, data, palavras e o sha256 calculado na hora da coleta.

Por que aprender:

O sha256 é o que permite provar, nas trilhas 3 e 4, que a wiki e as citações vêm de um raw que ninguém mexeu.

Conceitos-chave:

Impressão digital · url = chave de "já coletado" · arquivo = chave de atualização.

O que é:

Uma tabela em raw/ com data, tipo, origem e motivo de cada fonte que não deu texto. Tem de existir mesmo vazia.

Por que aprender:

No piloto, a única linha ("sem legenda") levou a preencher o transcritor e recuperar 8.045 palavras que teriam ficado de fora.

Conceitos-chave:

Histórico, não pendência · nunca apagar a linha · prova de que foi olhado.

O que é:

Metas de itens e palavras por tipo no config, conferidas pelo stats.py junto com o sha256 de cada arquivo e a existência do relatório.

Por que aprender:

No piloto, 6 guias deram 7.269 palavras contra 8.000: exit 1. Com +1 guia e a transcrição, 21 itens e 187.382 palavras: exit 0.

Conceitos-chave:

Exit code · metas_coleta · calibrar a meta depois de listar as fontes · "faltam N palavras".

O que é:

O manifesto do kit 1.1 era regravado inteiro sem trava; o agente percebeu que coletas em paralelo apagariam itens umas das outras e rodou em sequência.

Por que aprender:

Condição de corrida perde dados em silêncio. O kit 1.2 ganhou trava de arquivo e escrita atômica, com teste de 12 coletas simultâneas.

Conceitos-chave:

Ler-alterar-gravar · condição de corrida · flock · os.replace.

O que é:

A transcrição local foi salva com o nome que o transcritor deu; a próxima live transcrita gravaria por cima e o manifesto perderia o item.

Por que aprender:

Gravidade alta no diário do piloto. Agora o nome é título + ID do vídeo (ou hash da URL) — e o transcript.txt original segue no raw como evidência.

Conceitos-chave:

Perda silenciosa · nome único por fonte · yt-dlp --print · raw imutável.

Ver Completo
← Trilha 1: Por que um mentor Trilha 3: Wiki compilada →