Referência · 24/09/2026

Esforço na prática

Dois experimentos rodaram o mesmo pedido em todos os níveis de esforço: um com o Claude Opus 5.5 e outro com o GPT-6 Astra. Os dois mostram o mesmo padrão: o nível máximo nunca foi o preferido.

Esta página é referência: não muda a pilha nem as regras do guia. São dados de terceiros, com uma rodada por nível e julgamento de uma pessoa. Fontes em texto: padroes-esforco · vídeo Opus 5.5 · astra-effort.
Fonte A · Claude Opus 5.5

O mesmo app 3D em seis níveis

Tarefa: um /goal longo que transforma ~105 GB de gravações de um evento virtual em uma conferência 3D explorável. O autor preferiu o xhigh (“Extra” no vídeo). O max custou o dobro e teve mais bugs.

12,9×
custo do max em relação ao low
2,3×
aumento de checks no mesmo intervalo
1 / 6
execuções que fizeram alguma pergunta (0 usaram subagente)

Quanto cada métrica cresce (low = 1×)

Custo e tempo disparam; checks quase não se mexem.

Ver tabela
NívelTokensCustoTempoChecks
low1,001,001,001,00
medium2,193,184,371,05
high2,934,174,011,00
xhigh ★3,796,635,381,55
max6,1812,888,852,32
ultracode—4,785,681,91

Custo estimado por nível (US$)

Estimativa em preço de API; o autor rodou na assinatura. Em destaque, o preferido.

Ver tabela
NívelTempoCustoTokensChecksPerguntas
low16m43s3,91191k220
medium1h13m12,44419k230
high1h07m16,31~559k221
xhigh ★1h30m25,92~723k340
max2h28m50,381,18M510
ultracode1h35m18,69?420

~ = número falado de forma truncada no vídeo. Os tokens do ultracode foram ditos como “66 mil”, o que não bate com 1h35m de execução; ficam como desconhecidos.

low → medium

Maior salto de percepção: marca certa, vídeos reais tocando, estandes e área VIP.

high → xhigh

Ganho de interação: conversar com personagens, sentar nas palestras, abrir recursos.

xhigh → max

2× o custo e +1h de execução, com caminhada ruim, glitches e vídeo que não tocava. Regrediu.

Fonte B · GPT-6 Astra

Pesquisa + micro-SaaS em sete condições

Dados do kit traduzido em astra-effort: a mesma tarefa de pesquisa e construção de 30 a 46 minutos. O autor preferiu o medium, que foi o mais rápido e ainda entregou o fluxo verificado. Sol high e Astra ultra (com 3 subagentes) aparecem como condições à parte.

Tempo por condição (minutos)

O low demorou mais que o medium. Esforço baixo não garante menos trabalho.

Tokens de saída (mil)

Sobe sempre com o esforço. O orçamento de raciocínio é gasto com ou sem retorno.

Ver tabela
CondiçãoTempoTokens processadosTokens de saídaNota do produtor
low37m37s14,81M51,5kmais tempo e tokens que o medium
medium ★30m41s10,23M42,2kpreferido: fluxo verificado no menor tempo
high41m21s14,33M57,4kbom com restrições que interagem
xhigh45m14s12,29M67,7kachou evidência contra a própria ideia
max46m10s10,55M70,2ko mais longo; precisão em valores e regras
ultra (3 filhos)42m10s21,73M96,0k+7,12M dos filhos; produto parecido
Sol high32m49s6,70M54,2kbarato, mas um caminho de decisão quebrado

Os tokens processados incluem ~98% de entrada em cache e não representam custo. Não compare com os tokens da Fonte A em valor absoluto: compare só a forma das curvas.

Cruzando as fontes

Oito padrões

Inclui a Fonte C, um teste interno registrado no maestro-roteador: de high para max, “a diferença foi um favicon, por 2–5× os tokens”.

O máximo nunca foi o preferido

Preferidos: xhigh no Opus e medium no Astra; no maestro, high ficou praticamente igual ao max. No vídeo do Opus, o max regrediu.

O ponto ideal muda com a tarefa

Tarefa delimitada de ~40 min → medium. Construção autônoma de horas, com muito material → xhigh. Quem decide é o quanto há para ler e decidir.

O raciocínio é sempre gasto; o retorno não vem sempre

Os tokens de saída sobem de forma monotônica. O custo sobe 12,9× do low ao max. O orçamento é consumido de qualquer jeito.

O custo total não é linear

Astra low demorou mais que medium; Opus high terminou antes do medium. Esforço baixo não garante trabalho menor.

Mais checks não significam menos bugs

O max do Opus fez 51 verificações e ainda teve mais glitches que o xhigh, com 34.

Delegação é outra condição

Astra ultra acrescentou +7,12M tokens com 3 subagentes, sem mudar o produto. O ultracode do Opus não delegou nada e se comportou como xhigh.

Esforço não compra perguntas

Houve 1 pergunta em 6 execuções. A ambiguidade precisa ser resolvida no pedido, não subindo o esforço.

Esforço compra deliberação, não gosto

O salto de “sensação” veio entre low e medium. Daí em diante, o ganho foi de interação e detalhe, o que bate com o eixo modelo × esforço do maestro.

🧭 Opinião do Nei: como uso o esforço

medium · padrão→high · quando precisar de mais raciocínio→xhigh · caso extremo

Usar o Opus 5.5 em medium é a melhor opção para o dia a dia. Subo para high quando a tarefa pede mais raciocínio e só uso xhigh em caso extremo.

O mesmo vale para o GPT-6 Astra. O max fica de fora: nas duas fontes, ele custou mais e não entregou mais.

⚖️ Conclusão

Esforço é orçamento de exploração, não botão de qualidade.

Comece no menor nível plausível; na dúvida, medium. Suba só com evidência de resultado insuficiente e trate max/ultra como exceção justificada. Essa regra já está no guia e no maestro-roteador.

O que este material acrescenta é um teto observado: em construção autônoma longa com Opus 5.5, o xhigh foi o melhor e o max não compensou.

Limites dos dados

  • Uma rodada por nível em cada fonte; a variação entre execuções não foi medida.
  • Julgamento visual de uma pessoa. A Fonte A tem patrocinador; a Fonte B foi traduzida sem nova execução.
  • Os custos da Fonte A são estimativa em preço de API.
  • Ainda não há teste INEMA próprio. Para rodar um, use avaliacao/bateria.md.