PTENES
← Biblioteca Astra Effort
Nesta página

Testei todos os níveis de esforço do GPT-6 Astra. Eis o que eu usaria — YouTube

https://www.youtube.com/watch?v=OQipTxv9Qv0

Transcrição traduzida para português. Opiniões e aproximações numéricas são do narrador. A transcrição automática original está em original-en/docs/transcricao-video.txt; nomes evidentes como “GBT6”, “Astro”, “Soul” e “Excel draw” foram normalizados para GPT-6, Astra, Sol e Excalidraw. Para os números exatos e limites metodológicos, consulte SUPER-GUIDE.md e evidence/results.json.

(00:00) O GPT-6 Astra já está disponível há algum tempo, e uma das maiores discussões no YouTube e no X é esta: qual nível de esforço oferece o melhor valor ou retorno pelo que você gasta com esse modelo? Também vi pessoas dizendo que ele é inerentemente preguiçoso.

(00:17) Ele faz o que você manda, mas nada além disso, e às vezes nem isso. Então fiz alguns experimentos para ver se mudar o esforço também mudava esse comportamento. Testei todos os níveis de Astra no mesmo projeto de pesquisa e construção e incluí Sol na comparação. Neste vídeo, vou mostrar o que cada um entregou, quanto tempo levou, quantos tokens consumiu e se o esforço teve alguma influência.

(00:42) Ao final, você poderá avaliar qual nível combina com seus projetos cotidianos. Vamos começar. Esta publicação no X foi o motivo de eu querer fazer o teste. Tibo lidera os produtos principais da OpenAI e também é conhecido como quem parece reiniciar sua franquia de uso a cada hora. Ele fez uma afirmação ousada.

(01:00) GPT-6 Astra em Low tem desempenho melhor que GPT-6 Sol em High. Sol é o modelo anterior e está sendo esquecido por causa desta novidade. Mas, para muitos objetivos e tarefas, ainda é mais que suficiente. Quando você investiga experiências reais e relatos sobre este modelo, especialmente em Low, ouve que ele para cedo demais e pede permissão a cada cinco minutos.

(01:26) Eu queria avaliar duas coisas: esforço extra necessariamente melhora os resultados? E oferece mais autonomia, fazendo o modelo parar de pedir permissão e de parecer preguiçoso? Na documentação oficial da OpenAI, encontramos o seguinte.

(01:42) O modelo foi projetado para colaborar melhor e, por isso, tende a fazer mais perguntas ao usuário. A documentação também diz que isso pode fazê-lo parar quando o usuário esperava suposições razoáveis. Algo como Fable 5.1 é muito bom quando você dá uma visão geral, um resumo do objetivo, e ele não apenas extrapola, mas acrescenta etapas que considera adequadas.

(02:06) Parece que Astra, pelo menos em alguns níveis de esforço, talvez não faça isso tão bem. Para que o experimento fosse o mais transparente e equilibrado possível, controlei seis variáveis: mesmo contexto, mesmo acesso a ferramentas, MCPs e skills, mesmo escopo de construção e mesmas condições. E separei Ultra porque ele frequentemente cria uma série de subagentes.

(02:29) Vou mostrar um pequeno truque para abrir várias conversas com esforços diferentes usando o mesmo prompt. E, por último, registramos quantos tokens e quanto tempo cada conversa consumiu. Este foi o prompt enviado às sete conversas; vou explicá-lo por partes.

(02:47) A essência era permitir que cada agente pesquisasse tudo que pudesse no X e no Reddit, dois ótimos lugares para ouvir comentários de usuários. O cliente central era este: encontre uma oportunidade de SaaS que valha a pena para donos de pequenas empresas de serviços com 2 a 20 funcionários.

(03:07) Não escolhi a categoria, o problema ou o produto. Comece pelos problemas, considere três oportunidades e escolha uma. Para as evidências, pedimos pesquisa nessas plataformas e análise de três alternativas existentes à ideia inicial. O objetivo era reunir frustrações recorrentes, soluções improvisadas, sinais de gasto e evidências contrárias.

(03:29) Esta é a frase mais importante do prompt para avaliar a oportunidade: suponha que clientes e concorrentes possam usar Astra para reproduzir rapidamente um software competente. Ou seja, não construa um SaaS que possa ser feito por vibe coding em um fim de semana. Idealmente, o modelo de negócio deve ter alguma vantagem defensável.

(03:47) Para o planejamento, queria que ele criasse seus próprios arquivos Excalidraw usando IA para gerar os JSONs correspondentes. Com modelos mais avançados, já não preciso de uma skill: posso pedir um arquivo Excalidraw. É um formato que permite anotar e criar diagramas como se eu os tivesse desenhado à mão.

(04:08) Em vez de uma skill, queria que cada nível demonstrasse a criação do arquivo inteiro para observar a organização do raciocínio. Para o produto principal, queria um site bem acabado, parecido com os sites que preparo para explicar esses conceitos no YouTube.

(04:26) Queria um site do ChatGPT que explicasse o plano completo de construção depois da pesquisa. Além do site e do arquivo Excalidraw, queria um protótipo funcional do SaaS. Dividir a tarefa nessas partes daria espaço para cada nível mostrar diferenças reais, se existissem.

(04:48) As perguntas centrais eram: conseguimos rastrear a justificativa de que é uma boa ideia? Por que alguém pagaria? As peças se conectam — o perfil escolhido, a dor apontada e as evidências dela, o produto? O fluxo funciona? Faz sentido existir como SaaS? E, quanto à conclusão, ele terminou e verificou seu trabalho? Refletiu sobre o que aconteceu? Estas são todas as conversas que executamos.

(05:17) Eu estaria mentindo se dissesse que abri todas manualmente. Basta pedir ao Codex uma série de conversas e solicitar que as renomeie pelo nível de esforço, altere o esforço e as vincule a uma pasta específica. Você pode pedir algo assim.

(05:38) Quero que use o mesmo prompt; você pode criá-lo. Deve ser uma tarefa muito simples. Crie três conversas separadas, com nomes fáceis de ler na barra lateral, cada uma com um nível de Astra: Low, Medium e High. Execute esse prompt nas três ao mesmo tempo, agora.

(05:58) E acompanhe o progresso de cada uma. Essa é uma funcionalidade recente que está funcionando tanto em Claude quanto em Codex. Ao abrir os itens recentes, vemos as novas conversas de teste começarem a aparecer separadamente. Aí estão.

(06:17) Agora temos Astra Medium, Low e High, todos em execução. Ao entrar, vemos a mesma tarefa. Assim você começa a testar em escala. O resultado de cada conversa foi um quadro como este, um site, uma análise completa e as estatísticas de tokens, tempo e resultado principal.

(06:39) Astra em Low levou 37 minutos, consumiu quase 15 milhões de tokens, passou por oito conversas do Reddit e nenhuma do X e criou 161 elementos no quadro. Isso não mede necessariamente qualidade; mostra quanto trabalho produziu. O produto acompanha tarefas de limpeza não realizadas até a correção e a nova verificação, para donos de empresas de limpeza comercial que atendem escritórios regularmente.

(07:03) A vantagem proposta são padrões específicos dos clientes e histórico de correções que funcionaram. Interessante. O site ficou assim. Não estamos avaliando beleza, e sim o conceito central. É o rascunho deste SaaS. Não impressiona muito, mas talvez seja um negócio viável.

(07:23) A grande lacuna é não haver evidência do X, e ele não foi além do pedido. Astra Medium levou apenas 30 minutos, 10 milhões de tokens e seis conversas no Reddit. O produto calcula preços de serviços extras de limpeza e registra a aceitação do cliente, para empresas com contratos por escrito.

(07:42) A vantagem proposta são registros precisos de escopo e estimativas aprimoradas pelos serviços reais. Não sei o quanto isso é uma vantagem defensável. O interessante é que estamos outra vez no setor de limpeza, embora eu não o tenha especificado. Talvez, dado o perfil e o escopo fornecidos e todas as condições, esse pareça o melhor setor.

(08:02) O site é parecido. Ao explorar o plano e abrir o quadro, a divisão parece mais clara: cliente, alternativas, oportunidade e jornada do dono. Há uma boa análise das consequências. Eu precisaria ler tudo para avaliar o modelo de negócio em detalhe, mas a qualidade e a variedade das análises parecem melhores que Low, com menos tempo e tokens.

(08:31) Astra High levou perto de 40 minutos e 14 milhões de tokens. Pesquisou no Reddit e finalmente uma publicação ou conjunto de publicações no X, e criou o quadro mais detalhado. A ideia foi redistribuir visitas quando uma equipe de limpeza não pode trabalhar.

(08:50) Talvez seja a descrição mais simples até agora: para donos de empresas de limpeza residencial que coordenam equipes e horários. A vantagem proposta são restrições específicas da empresa e resultados que melhoram o agendamento. Até aqui, o site é o mais claro quanto à visão e à dor. A dor aparece aqui.

(09:09) Às 7:42, a van de Cedar não liga. Há duas visitas recorrentes que precisam de cobertura; precisamos preencher horários que seriam cancelados. A ideia tenta reduzir receita perdida. Mas valeu gastar 40 minutos e 14 milhões de tokens, ou daria para usar os 30 minutos de Medium e um prompt mais preciso, ou um acompanhamento, para chegar ao mesmo ponto? Extra High levou 45 minutos, mas consumiu um pouco menos que High: 12 milhões.

(09:40) O interessante, e o motivo de eu dizer que isto não é AGI e considerar muitas dessas afirmações exageradas, é que o nível de esforço deveria de alguma forma corresponder à eficiência, mas não corresponde. High ficou perto de 14 milhões de tokens.

(09:59) Low ficou perto de 15 milhões e Medium perto de 10 milhões. Há variação e imprevisibilidade. Se eu repetisse, diria que provavelmente os tempos seriam parecidos, mas os tokens consumidos são cada vez mais imprevisíveis.

(10:16) Desta vez o negócio não é limpeza. Ele leva adicionais de reforma da aprovação ao faturamento, para pequenos empresários que perdem o controle do que cobrar. A vantagem proposta são verificações de escopo personalizadas pelo histórico de aprovação, faturamento e pagamento. Uma descrição longa. O site parece no nível de High, mas fica pior quando você examina por dentro.

(10:39) Tem layout parecido e quatro abas semelhantes. O quadro conectado abre em uma nova aba, um efeito agradável. Há filtros e botões para navegar. Mas, em escopo e aparência, o quadro parece um pouco pior que o de High. Esta era a versão High.

(11:01) Ela também tem botões, com outra posição e um pouco mais apertados, e mais evidências para cada afirmação. Ao clicar em evidências dos clientes, você vai diretamente à conversa associada. Há uma divisão melhor e mais fontes ligadas às conversas exatas. Comparando lado a lado, a versão Extra High é mais simples e menos detalhada.

(11:29) Tem menos referências e navegação um pouco melhor. Fora isso, não vejo benefício adicional pelos cinco ou dez minutos extras e pelos possíveis tokens além de Medium e High. Max me confundiu: levou 46 minutos, mas consumiu apenas 10 milhões de tokens.

(11:50) Foi eficiente em tokens, mas um pouco ineficiente no tempo para chegar a esse consumo. A ideia mantém escopo, preço e aprovação de serviços extras em um registro. Parece orientada a banco de dados ou organização dos dados, para donos de empresas de reforma residencial com equipes de 2 a 10 pessoas.

(12:09) A vantagem proposta é uma rotina adotada no canteiro, configuração assistida e indicações de profissionais contábeis. Interessante: pensa em um negócio apoiado por indicações. Quero destacar que, mesmo em Max, não há referências ao X, embora elas tenham aparecido em High.

(12:27) Mais uma evidência de que gastar mais tokens — ou, aqui, mais tempo para processá-los — não melhora necessariamente o resultado. O site está mais limpo e acabado. Parece um produto real em comparação com High e Extra High. Transmite a visão e o problema que estamos tentando resolver.

(12:49) Mas você gastaria dez minutos extras em vez de acrescentar um ou dois prompts a um nível inferior? Chegamos a Astra Ultra: 42 minutos, menos que Max, mas impressionantes 22 milhões de tokens para este resultado. Isto é o que se obtém com 22 milhões de tokens.

(13:10) Registra e combina adicionais de reforma antes do início do trabalho. Basicamente automatiza solicitações de alterações de serviço para pequenos empresários de reforma residencial que lidam com extras frequentes. A vantagem proposta é configuração específica da especialidade e uma rotina comprovada, melhorada por resultados reais. O site não é uma obra-prima de Da Vinci.

(13:29) Parece muito com os anteriores, com pequenas mudanças de espaçamento e acabamento que não acrescentam tanto à experiência. Ao explorar a oportunidade, há um botão com relevo e um quadro quase idêntico ao que já vimos.

(13:47) Há duas fontes em uma posição estranha: um conjunto extra de fontes por bloco. Isso vale o tempo e os tokens adicionais? Vinte milhões de tokens e subagentes para montar isso. Como comparação de controle, também testamos Sol High, porque, pela publicação de Tibo, Astra Low deveria oferecer experiência equivalente. Sol levou só 32 minutos.

(14:12) Apenas 6 milhões de tokens. Se você esqueceu Sol, há motivo para lembrá-lo. Astra não deveria ser usado para tudo. Não é necessário levar uma bomba nuclear para toda briga de socos. Surpreendentemente, ele pesquisou seis conversas do Reddit e duas do X. Quantidade não representa necessariamente qualidade, mas ao menos essas fontes foram consultadas.

(14:36) O plano de negócio organiza a recuperação quando atrasos afetam uma rota de serviços, muito parecido com o anterior. O público são donos que também coordenam operações de empresas de serviços recorrentes com 2 a 20 funcionários. A vantagem são resultados de recuperação, regras mantidas e suporte responsável. Espero que o site não seja tão bonito, mas seja funcional.

(14:56) Certo, isto é incrivelmente feio; é tão ruim que dá vontade de fechar os olhos ou apertá-los. Acho que a primeira imagem tenta mostrar um diagrama do modelo de negócio. Posso dizer facilmente que Astra é bem melhor em sites e em criar rapidamente esse tipo de site do ChatGPT.

(15:17) Mas a pergunta real é: daria para usar uma skill que criasse um site bonito, com espaçamento adequado, e continuar com Sol High ou Medium? Pelo experimento e pelo meu uso cotidiano, adoro Astra Medium em Fast. É minha configuração favorita entre as versões dos modelos do Codex. É rápida.

(15:37) Não consome tokens em ritmo alarmante e é bem eficiente. Encontrei o mesmo neste experimento: site, estrutura, plano de negócio, modelo de negócio e quadro pareciam muito semelhantes entre Medium e High.

(15:53) Se você quiser um pouco mais de qualidade, pode usar High e gastar alguns tokens adicionais. Mas, para a maioria das tarefas diárias, se quiser Astra — embora não deva usá-lo para tudo — Medium é mais que suficiente. Espero que isso ajude a entender qual esforço pode funcionar para você.

(16:12) Com base neste teste e em outros que fiz, vejo poucos casos em que Max, Extra High ou Ultra valem o tempo, esforço ou tokens extras. Fiz muitos outros testes e documentei descobertas, informações adicionais e dicas sobre quando usar diferentes níveis em certos tipos de tarefa.

(16:34) Vou disponibilizar isso no segundo link da descrição. Você pode pegar gratuitamente, fornecer ao Codex ou ao Claude e pedir uma explicação. E, como sempre, se quiser estar adiante em IA, especialmente na aplicação prática no trabalho, no negócio, para aprender ou ganhar dinheiro, confira o primeiro link abaixo.

(16:57) Aprofundo bastante assuntos como este na comunidade Early AI Dopters. Se gostou e achou útil, agradeço uma curtida no vídeo — ajuda o alcance — e um comentário, se quiser. Vejo vocês no próximo.