Mapa da trilha
🔧 Busca vira ferramenta
Mapear o site uma vez, rodar para sempre
🧪 Testar ferramentas dentro do app
Seu MCP visto por quem nunca o usou
🔁 Um agente testa outro
Computer use auditando computer use
🎬 A entrega da edição
Do render ao link, sem esperar acordado
📱 O celular pelo computador
Espelhar, configurar, provar que persistiu
Conteúdo detalhado
🔧 Busca vira ferramenta
Google Flights não tem API. Com computer use você faz a busca uma vez, o agente entende como chegou lá e gera uma ferramenta de linha de comando que qualquer agente, com qualquer modelo, roda depois. É o fluxo que mais rende porque transforma um custo repetido em custo único.
Tópicos do módulo
O que é
O caso de uso: uma busca repetida num site fechado (voos, imóveis, peças) que hoje exige uma pessoa ou uma sessão inteira de computer use a cada vez.
Por que aprender
Cada execução de computer use custa dezenas de segundos e capturas de tela. Se a busca se repete, o custo certo é o de construir a ferramenta, não o de repetir a navegação.
Conceitos-chave
Busca repetida, site fechado, ferramenta reutilizável, custo único contra custo recorrente.
O que é
O prompt do kit para o primeiro fluxo: entradas explícitas, inspeção da interface pelo navegador interno, separação planejador/adaptador, exportação em JSON e CSV, duas execuções de verificação.
Por que aprender
É o prompt mais longo dos cinco e o mais instrutivo: cada frase corresponde a uma falha que aconteceu antes.
Conceitos-chave
Navegador interno explícito, entradas nomeadas, exportação, verificação em duas datas, "search only".
O que é
A arquitetura que o prompt exige e que o google-flights-cli do kit implementa: planejamento, replay de capturas, exportação e comparação de histórico rodam no terminal; tarifa nova exige o navegador interno do Codex.
Por que aprender
Quem não entende essa fronteira acha que a CLI "não funciona" quando ela devolve "requires_codex". Ela funcionou: gerou o plano. Falta o navegador.
Conceitos-chave
requires_codex, replay de captura, exportação, comparação de histórico, fronteira declarada.
O que é
A prova de conclusão do fluxo 01: execuções separadas por pasta, comparação de um resultado exportado com a página, campos desconhecidos marcados como tal, e distinção entre preço exibido e itinerário selecionado.
Por que aprender
Uma ferramenta de busca que exporta o número errado é pior do que nenhuma, porque parece certa.
Conceitos-chave
Pasta nova por execução, comparação com a página, unknown em vez de zero, from-price contra itinerário.
O que é
A extensão do fluxo: janelas de datas, aeroportos alternativos, trajetos abertos (chegar por uma cidade e voltar por outra) e escalas planejadas, com um teto de buscas no navegador.
Por que aprender
É onde a ferramenta deixa de repetir a sua busca e passa a encontrar combinações que você não tentaria à mão. E é onde mais se inventa: preço global mais barato, assento de milhas disponível.
Conceitos-chave
Janela de datas, aeroporto alternativo, open-jaw, orçamento de buscas, custos ocultos, bilhetes separados.
O que é
O teste comparativo do kit: a mesma busca nova em duas sessões limpas, uma com a ferramenta gerada e outra com computer use puro, alternando a ordem, com o tempo definido antes.
Por que aprender
Uma ferramenta que não é mais rápida do que refazer a navegação não vale a manutenção. O vídeo mediu: 70% e 50% menos tempo. Mas em duas buscas.
Conceitos-chave
Sessões limpas, mesma cobertura, ordem alternada, tempo definido antes, amostra pequena.
🧪 Testar ferramentas dentro do app
Quem publica um MCP, uma skill ou um plugin sabe: o mais difícil é simular o primeiro uso de outra pessoa. Este fluxo coloca o Codex para abrir o Claude Desktop, instalar a sua ferramenta, conversar com ela, abrir cada chamada e devolver a jornada inteira com evidência.
Tópicos do módulo
O que é
O problema que o fluxo resolve: mapear a experiência real de alguém que pega o seu MCP ou skill, conecta ao Claude ou ao Codex e usa pela primeira vez.
Por que aprender
Você pula os passos que já sabe. Um agente com instruções de usuário novo não pula nenhum, e registra onde travou.
Conceitos-chave
MCP, app hospedeiro, jornada do usuário, chamada de ferramenta, primeiro uso.
O que é
O prompt do kit: app hospedeiro, nome da ferramenta, fonte segura de teste, resultado esperado, pedido só de leitura, inspeção da chamada, dois follow-ups, caso sem resultado, conferência com a fonte, relatório curto.
Por que aprender
É o prompt que transforma "acho que funciona" em "passou em seis checagens, falhou em uma, a correção de maior valor é esta".
Conceitos-chave
Só leitura, preservar configuração, parar em login, não reconstruir o que existe, relatório curto.
O que é
A instrução central do fluxo: o agente clica nos painéis expansíveis do app para ver quais parâmetros entraram na ferramenta, quais registros voltaram e de onde, em vez de ler só o texto final.
Por que aprender
A resposta final pode estar certa por acaso, ou bonita e errada. A chamada mostra se a ferramenta foi usada, como e com quê.
Conceitos-chave
Painel de chamada, parâmetros de entrada, registros devolvidos, fonte de cada item.
O que é
Dois follow-ups que dependem da primeira resposta (testam contexto) e uma pergunta cuja resposta a ferramenta não tem (testa honestidade).
Por que aprender
Um MCP que responde bem a uma pergunta isolada e se perde na segunda, ou que inventa quando não sabe, falha exatamente onde o usuário real vai estar.
Conceitos-chave
Dependência da resposta anterior, contexto retido, incerteza declarada, lista vazia.
O que é
Duas exigências do prompt: uma resposta material conferida contra a fonte de origem, e registro de tempo decorrido com separação entre modelo, ferramenta e configuração só quando a evidência sustentar.
Por que aprender
Tempo é o que o usuário sente. Mas uma decomposição de tempo inventada é pior do que nenhuma, porque orienta a otimização errada.
Conceitos-chave
Fonte de origem, tempo decorrido, tempo do modelo, tempo da ferramenta, atrito de configuração.
O que é
O formato de saída: checagens que passaram, falhas reproduzidas, evidência e a única correção de maior valor, com localização provável no código quando houver. E a extensão: usar o mesmo fluxo para testar uma skill em outro app que não tem plugin.
Por que aprender
O vídeo recebeu, além do relatório, a indicação de duas funções cuja estrutura causava latência. É o tipo de retorno que um usuário humano nunca escreve.
Conceitos-chave
Passou, falhou, evidência, maior correção, localização sem alterar, ponte entre apps.
🔁 Um agente testa outro
Você construiu um app com agentes e o recurso mais fraco é o computer use dele, porque é o mais difícil de ensinar a um agente do zero. A solução do vídeo: usar o computer use do Codex para assistir o seu app usar o dele, registrar a falha exata, ligar ao código e retestar no mesmo teste.
Tópicos do módulo
O que é
O cenário do vídeo: um app próprio (um clone de assistente com vários agentes) cujo recurso de computer use é o menos confiável. O Codex abre o app, pede que ele navegue, e observa cada ação do agente interno.
Por que aprender
Testar um agente pela interface real, com outro agente, é o único jeito de ver o que o usuário vê, incluindo o que o seu log não mostra.
Conceitos-chave
App-alvo, agente interno, observador externo, ponto exato de falha.
O que é
O prompt do kit: app, repositório correspondente, tarefa de navegador, fonte pública para conferir, critérios de sucesso; conversa limpa; observar sem substituir; conferir um fato; fechar e reabrir; reproduzir, corrigir a menor causa, retestar, com teto de três tentativas.
Por que aprender
Cobre o ciclo inteiro, da observação ao reparo, com os freios que evitam um agente reescrevendo o seu app de madrugada.
Conceitos-chave
Conversa limpa, não substituir, persistência, menor causa, três tentativas, sem deploy.
O que é
A proibição central: o agente externo não pode fazer a tarefa ele mesmo e marcar o app como aprovado. Ele observa o app fazer.
Por que aprender
Um agente capaz, vendo o app travar, tende a "ajudar" e completar a tarefa. O relatório sai verde e o bug continua lá.
Conceitos-chave
Observar, não executar, aprovação falsa, evidência das ações do app.
O que é
Depois da tarefa, o observador fecha a conversa do app e reabre, confirmando que o resultado e o contexto continuam lá.
Por que aprender
Um agente pode acertar a tarefa e perder tudo ao reabrir. Para o usuário, isso é o mesmo que ter falhado.
Conceitos-chave
Reabrir, contexto retido, resultado persistido, janela de contexto, compactação.
O que é
O modo de reparo do prompt: reproduzir a falha, confirmar que o código compila o app, corrigir a menor causa na cópia de desenvolvimento, rodar testes, relançar e repetir o teste de interface idêntico. No máximo três vezes.
Por que aprender
Sem o teto, um agente autônomo pode passar horas reescrevendo. Sem "menor causa", ele refatora o app inteiro para corrigir um seletor.
Conceitos-chave
Reproduzir, menor causa, testes relevantes, relançar, teste idêntico, teto de três, evidência e próximo passo.
O que é
A extensão que o vídeo sugere: rodar o ciclo por horas com um objetivo declarado e acordar com uma lista de bugs encontrados e corrigidos. E a adaptação do guia para apps sem agente: substituir a tarefa de navegador por uma jornada de usuário.
Por que aprender
O valor real do fluxo está na repetição sem você. Mas repetição sem teto e sem prova é dívida técnica automática.
Conceitos-chave
Objetivo declarado, teto de tentativas, jornada de usuário, criar-salvar-reabrir.
🎬 A entrega da edição
Renderizar em 4K leva de 40 minutos a 4 horas. Depois vem subir no editor, aplicar a limpeza, revisar cada corte, exportar, mandar para a equipe. O agente espera o render, faz a parte de interface que nenhuma linha de comando alcança, e só entrega quando o arquivo exportado abre, tem imagem e som e o conteúdo único sobreviveu.
Tópicos do módulo
O que é
O fluxo completo do vídeo: clicar em renderizar, o agente verificar o progresso a cada 30 minutos, abrir o Descript, importar, enviar o prompt de limpeza, revisar os cortes, exportar, subir no Drive e mandar o link.
Por que aprender
Ferramentas como o Descript têm linha de comando própria que cobre parte do trabalho. A parte que falta é exatamente a que exige olhos: o chat do editor, os frames, a confirmação visual do export.
Conceitos-chave
Render, polling, importação, transcrição, limpeza conservadora, export, verificação de mídia.
O que é
O prompt do kit: vídeo de origem, pasta e nome de saída, pasta opcional do Drive, arquivo do prompt de limpeza; verificar estabilidade e propriedades do original; projeto novo; limpeza; comparação de transcrições; revisão dos cortes; export na resolução da fonte; verificação da mídia; upload opcional.
Por que aprender
É o prompt com mais verificações de mídia do kit, porque vídeo é onde "pronto" mais engana: o arquivo existe, tem o nome certo, e está corrompido.
Conceitos-chave
Original preservado, projeto novo, prompt completo enviado, comparação de transcrições, export verificado, sem publicar.
O que é
O comportamento de espera: verificar periodicamente, e só considerar o render terminado quando o arquivo para de crescer e decodifica.
Por que aprender
Um render em andamento já tem nome e já está na pasta. Importar nesse momento produz um vídeo cortado no meio.
Conceitos-chave
Estabilidade do arquivo, tamanho constante, decodificação, acompanhamento agendado.
O que é
O prompt de limpeza que acompanha o kit (prompt 07), resumido nas regras que importam: manter o último take, nunca cortar conteúdo único, deixar respiro ao redor de cada corte, separar retake de frase nova, checar coerência, ajustar o ritmo por trecho.
Por que aprender
Uma limpeza agressiva parece eficiente e destrói o vídeo. O prompt é longo justamente para forçar o editor a errar para o lado de deixar.
Conceitos-chave
Último take, conteúdo único, respiro no corte, coerência, ritmo por trecho, na dúvida deixa.
O que é
A prova de conclusão do fluxo: o original intacto, o prompt completo enviado, o conteúdo único preservado, os cortes naturais, e o arquivo exportado verificado por número, não por aparência.
Por que aprender
Export é onde o "pronto" mais engana: arquivo com nome certo, tamanho plausível, e sem áudio.
Conceitos-chave
Decodificação, faixa de vídeo e de áudio, resolução da origem, duração reportada sem julgamento.
O que é
O fim do fluxo: upload opcional do export verificado, conferência de nome, tamanho e destino, e o link devolvido. No vídeo, o agente vai até o WhatsApp mandar o link para a equipe; o prompt do kit para antes disso.
Por que aprender
Enviar é irreversível. O kit deixa a decisão de publicar e de avisar pessoas fora do escopo do agente por padrão.
Conceitos-chave
Upload verificado, nome e tamanho conferidos, link devolvido, não publicar, não enviar.
📱 O celular pelo computador
Há apps que só existem no celular. Com o espelhamento do iPhone aberto no Mac, o agente assume a janela, entra no app, confirma a conta, aplica a configuração pedida e prova que ela persistiu. O caso do vídeo é um Instagram recém-criado; o padrão vale para qualquer app móvel.
Tópicos do módulo
O que é
O iPhone Mirroring do macOS mostra e controla o iPhone numa janela do Mac. Para o agente, é uma janela como qualquer outra: ele vê, clica e digita nela.
Por que aprender
É a única forma de computer use alcançar apps sem versão de desktop. E é a superfície com mais coisa sua exposta, o que muda as regras.
Conceitos-chave
iPhone Mirroring, janela alvo, autenticação sua, rótulos reais do app.
O que é
O prompt do kit: conta a confirmar, mudança pedida (no exemplo, ativar upload na qualidade mais alta), outras mudanças aprovadas; inspecionar antes, usar rótulos reais, aplicar só o pedido, verificar persistência, tabela antes/depois, sugestões separadas, proibições de privacidade e pagamento.
Por que aprender
É o prompt mais defensivo do kit, porque a superfície é a mais sensível: é a sua conta, no seu celular, com as suas fotos ao lado.
Conceitos-chave
Confirmar conta, mudança específica, já-correto, persistência, sugestões separadas, não tocar em privacidade ou pagamento.
O que é
A primeira ação dentro do app: ir até onde a conta ativa aparece, ler o identificador, comparar com o que você escreveu, e só então prosseguir.
Por que aprender
Apps de rede social permitem várias contas na mesma instalação. Uma configuração aplicada na conta errada é invisível até dar problema.
Conceitos-chave
Identificador visível, comparação literal, parar se divergir.
O que é
O formato de saída: uma linha por configuração, com o rótulo exato como aparece no app, o valor que estava, o valor que ficou e o resultado da verificação depois de reabrir a tela.
Por que aprender
É a prova de conclusão do fluxo. Sem a coluna "verificado", a tabela só diz o que o agente tentou.
Conceitos-chave
Rótulo exato, valor antigo, valor novo, verificado ao reabrir, três status.
O que é
A separação que o prompt exige: uma configuração de qualidade de upload é um fato verificável; "isso melhora o alcance" é uma afirmação sobre distribuição que precisa de documentação oficial atual.
Por que aprender
O vídeo parte de "vi em vídeos que existem configurações escondidas que ajudam". O kit corta o hype: verifique na fonte antes de recomendar.
Conceitos-chave
Fato verificável, afirmação de desempenho, documentação oficial, sugestão separada.
O que é
A extensão sugerida no vídeo: usar sub-agentes para pesquisar como otimizar um perfil (Facebook, X, outro app) e depois aplicar as mudanças pelo espelhamento. E a regra do guia para adaptar: nomear conta, configuração e valor alvo exatos, manter antes/depois e persistência.
Por que aprender
O fluxo separa pesquisa (o que mudar) de execução (mudar e provar). Misturar as duas é como o folclore entra.
Conceitos-chave
Pesquisa separada, lista aprovada por você, execução com prova, qualquer app móvel.