📦 A unidade de trabalho cresceu
Modelos anteriores já escreviam código. O que muda com o Astra é o tamanho da tarefa que sobrevive inteira de ponta a ponta: localizar o arquivo certo num projeto que ele nunca viu, editar, reiniciar o serviço, abrir a página, ler o resultado e reportar. Num projeto de agentes local, "troque o modelo da seção Codex para gpt-6-astra" foi de prompt a serviço reiniciado com o modelo novo em poucos minutos, sem apontar o arquivo. Isso é o que muda o loop: você deixa de escrever passos e passa a escrever resultados verificáveis.
✓ Pedido que aproveita o modelo
- ✓"Troque o modelo da seção Codex do projeto em localhost:3000 para gpt-6-astra. Reinicie o serviço e confirme abrindo a página."
- ✓"Refatore o CSS da tela principal para um visual mais moderno. Não mude comportamento. Me mostre o antes/depois."
- ✓"Gere um vídeo promocional de 30 s com Remotion a partir do README. Renderize em MP4 e me diga o caminho."
✗ Pedido que desperdiça o modelo
- ✗"Qual arquivo contém a configuração do modelo?" (você vai fazer o resto na mão)
- ✗"Escreva uma função que leia o config.toml" (pedaço, sem contexto do objetivo)
- ✗"Melhore o app" (sem critério de pronto: qualquer coisa serve, nada serve)
💡 Regra de bolso
Se você consegue descrever como vai saber que ficou pronto, delegue inteiro. Se não consegue, o problema é seu critério, não o modelo.
📊 Benchmarks: o que ler e o que ignorar
A página de lançamento apresenta o Astra como o modelo mais forte da OpenAI em uso de computador, engenharia de software, segurança e trabalho profissional, com ganhos grandes em benchmarks de agentes e resultados novos em problemas abertos de matemática. A tabela de custo por tarefa resolvida mostra o Astra abaixo dos concorrentes de fronteira, isto é, mais barato por tarefa concluída, não mais barato por token.
📊 O que os números não dizem
- •Benchmark mede tarefas de laboratório com critério de pronto definido pelo avaliador. O seu projeto não tem esse critério até você escrever.
- •Custo por tarefa resolvida assume que a tarefa foi resolvida. Uma tarefa mal especificada gera três tentativas caras.
- •Velocidade percebida ("fez em 2 minutos o que levava 30") vem de sessões ao vivo, não de medição controlada. Trate como indício.
- •Saturar um benchmark significa que ele parou de discriminar modelos, não que o modelo parou de errar.
⚠️ O erro clássico da primeira semana
Ler "melhor em computer use" e deixar o agente postar, publicar ou pagar sem revisar. Numa sessão de teste, o agente publicou um anúncio com o nome errado do produto. Funcionou; o conteúdo estava errado. Rascunho primeiro, sempre (módulo 1.3).
🧱 As três superfícies: app, Codex e CLI
O modelo é um só. O que muda é o harness em volta: quais ferramentas ele tem, onde os arquivos ficam, se a sessão persiste. No ChatGPT comum, o Astra pode não aparecer no seletor. Na área de trabalho do ChatGPT (o modo voltado a tarefas) e no app do Codex, ele aparece após atualizar o app. No CLI, é um valor de configuração.
| Superfície | Quando usar | Ferramentas | Estado |
|---|---|---|---|
| ChatGPT (chat) | Pensar, rascunhar prompt, revisar texto | Busca, arquivos anexados | Conversa |
| ChatGPT (área de trabalho) | Tarefas com navegador e apps do computador | Computer use via extensão, apps conectados | Conversa fixável |
| App do Codex | Projetos com pasta de código, várias sessões em paralelo | Editar, rodar, navegador interno, MCP, skills | Sessão por projeto, fork |
| Codex CLI | Terminal, automação, CI, scripts | Tudo do app + `exec` não interativo | Sessão retomável (`resume`) |
💡 Para quem já usa Claude Code
O mapa é 1:1. App do Codex ≈ Claude Code desktop; Codex CLI ≈ claude no terminal; skills ≈ skills; MCP é o mesmo protocolo. O que você aprendeu de contrato de prompt transfere sem ajuste.
🧾 O contrato de tarefa em três linhas
Três linhas. Resultado: o estado final, em uma frase observável. Onde: o arquivo, a URL, a pasta. Prova: o que o agente deve mostrar para você aceitar (saída de comando, screenshot, caminho de arquivo). Uma quarta linha opcional, escopo negativo, evita os efeitos colaterais mais comuns.
Copie e rode
Molde de contrato de tarefa. Cole no Codex, preencha os campos entre < >
Resultado: <o estado final, observável, em uma frase>
Onde: <pasta do projeto | URL | arquivo>
Prova: <comando cuja saída eu vou ler | screenshot | caminho do arquivo gerado>
Não faça: <o que está fora do escopo, ex.: não mude dependências, não faça commit>
Quando terminar, me mostre a prova antes de qualquer outra coisa.
Copie e rode
Contrato preenchido: trocar o modelo de um serviço local e confirmar rodando
Resultado: o serviço em http://localhost:<PORTA> usa o modelo gpt-6-astra na seção Codex.
Onde: pasta atual (este repositório).
Prova: saída de `grep -rn "gpt-6-astra" <ARQUIVO_DE_CONFIG>` e um screenshot da página com o modelo selecionado.
Não faça: não altere outros provedores, não instale dependências, não faça commit.
Quando terminar, me mostre a prova antes de qualquer outra coisa.
✓ Prova aceitável
- ✓Saída literal de um comando que você pode rodar de novo
- ✓Screenshot da tela final com o valor visível
- ✓Caminho de arquivo que você abre e confere
- ✓Diff resumido com os arquivos tocados
✗ Prova que não prova
- ✗"Feito, o modelo foi trocado com sucesso"
- ✗"Testei e está funcionando"
- ✗Resumo dos passos executados sem saída
- ✗Promessa de que "deve funcionar"
🧭 Onde as coisas somem: sessões, projetos e pin
Rodando várias tarefas ao mesmo tempo (troca de modelo, redesign de UI, vídeo, jogo), a barra lateral do app do Codex reorganiza a lista e uma conversa recém-criada parece ter sumido. Ela está em "recentes" ou dentro do projeto. A rotina: toda sessão que vai durar mais de uma resposta recebe pin na hora em que é criada; toda mudança arriscada nasce de um fork da sessão estável, não da própria.
Rotina de organização
Um projeto por pasta de código
Crie o projeto apontando para a pasta. Sessões daquele projeto herdam a pasta e as instruções dela (AGENTS.md).
Pin na criação
Antes de mandar o primeiro prompt longo, fixe a sessão. Desfixe quando a tarefa fechar.
Fork para experimentos
Redesign, migração, refatoração grande: fork da sessão que está funcionando. Se der errado, a original continua intacta.
Nomeie pelo resultado
"trocar modelo → astra", "UI v2", "vídeo promo remotion". Nomes por resultado são buscáveis; "nova conversa 7" não é.
Copie e rode
No CLI: retomar a última sessão e criar um fork dela para um experimento
# retoma a sessão mais recente deste projeto
codex resume --last
# abre um fork da sessão mais recente (a original fica intacta)
codex fork --last
# lista as sessões do daemon local (quando o app-server está ativo)
codex agents
💡 Conversa sumiu?
Antes de recriar: barra lateral → recentes, depois o projeto. Recriar a sessão perde o contexto que o agente já construiu sobre o projeto e custa tokens de novo.
🗺️ Mapa do curso e o que você vai construir
Trilha 1: operar
Ativar, delegar com contrato, usar o navegador com segurança, iterar num projeto com rollback. Sai com o loop funcionando.
Trilha 2: escalar
Ensinar o agente (skills), conectar ferramentas (MCP), controlar cota e custo, e dar memória comum aos agentes. Sai com o sistema.
Aprofundamento
Computer use em cinco fluxos completos está no curso irmão Computer Use com o GPT-6 Astra. Aqui você vê o essencial para operar com segurança.
Os prompts e comandos foram conferidos no Codex CLI 0.153 e no app do Codex em setembro de 2026. Menus mudam; o contrato e o loop não.
🧪 Teste rápido do módulo
Três perguntas. Clique numa opção para ver a resposta.
1. Qual pedido aproveita o que o Astra tem de novo?
2. O que um benchmark de computer use prova sobre o seu projeto?
3. Qual das opções é uma prova de conclusão aceitável?
📋 Resumo do módulo
Próximo módulo:
1.2 - Ativando: app, Codex e CLI