Dois experimentos rodaram o mesmo pedido em todos os níveis de esforço: um com o Claude Opus 5.5 e outro com o GPT-6 Astra. Os dois mostram o mesmo padrão: o nível máximo nunca foi o preferido.
Tarefa: um /goal longo que transforma ~105 GB de gravações de um evento virtual em uma conferência 3D explorável. O autor preferiu o xhigh (“Extra” no vídeo). O max custou o dobro e teve mais bugs.
Custo e tempo disparam; checks quase não se mexem.
| Nível | Tokens | Custo | Tempo | Checks |
|---|---|---|---|---|
| low | 1,00 | 1,00 | 1,00 | 1,00 |
| medium | 2,19 | 3,18 | 4,37 | 1,05 |
| high | 2,93 | 4,17 | 4,01 | 1,00 |
| xhigh ★ | 3,79 | 6,63 | 5,38 | 1,55 |
| max | 6,18 | 12,88 | 8,85 | 2,32 |
| ultracode | — | 4,78 | 5,68 | 1,91 |
Estimativa em preço de API; o autor rodou na assinatura. Em destaque, o preferido.
| Nível | Tempo | Custo | Tokens | Checks | Perguntas |
|---|---|---|---|---|---|
| low | 16m43s | 3,91 | 191k | 22 | 0 |
| medium | 1h13m | 12,44 | 419k | 23 | 0 |
| high | 1h07m | 16,31 | ~559k | 22 | 1 |
| xhigh ★ | 1h30m | 25,92 | ~723k | 34 | 0 |
| max | 2h28m | 50,38 | 1,18M | 51 | 0 |
| ultracode | 1h35m | 18,69 | ? | 42 | 0 |
~ = número falado de forma truncada no vídeo. Os tokens do ultracode foram ditos como “66 mil”, o que não bate com 1h35m de execução; ficam como desconhecidos.
Maior salto de percepção: marca certa, vídeos reais tocando, estandes e área VIP.
Ganho de interação: conversar com personagens, sentar nas palestras, abrir recursos.
2× o custo e +1h de execução, com caminhada ruim, glitches e vídeo que não tocava. Regrediu.
Dados do kit traduzido em astra-effort: a mesma tarefa de pesquisa e construção de 30 a 46 minutos. O autor preferiu o medium, que foi o mais rápido e ainda entregou o fluxo verificado. Sol high e Astra ultra (com 3 subagentes) aparecem como condições à parte.
O low demorou mais que o medium. Esforço baixo não garante menos trabalho.
Sobe sempre com o esforço. O orçamento de raciocínio é gasto com ou sem retorno.
| Condição | Tempo | Tokens processados | Tokens de saída | Nota do produtor |
|---|---|---|---|---|
| low | 37m37s | 14,81M | 51,5k | mais tempo e tokens que o medium |
| medium ★ | 30m41s | 10,23M | 42,2k | preferido: fluxo verificado no menor tempo |
| high | 41m21s | 14,33M | 57,4k | bom com restrições que interagem |
| xhigh | 45m14s | 12,29M | 67,7k | achou evidência contra a própria ideia |
| max | 46m10s | 10,55M | 70,2k | o mais longo; precisão em valores e regras |
| ultra (3 filhos) | 42m10s | 21,73M | 96,0k | +7,12M dos filhos; produto parecido |
| Sol high | 32m49s | 6,70M | 54,2k | barato, mas um caminho de decisão quebrado |
Os tokens processados incluem ~98% de entrada em cache e não representam custo. Não compare com os tokens da Fonte A em valor absoluto: compare só a forma das curvas.
Inclui a Fonte C, um teste interno registrado no maestro-roteador: de high para max, “a diferença foi um favicon, por 2–5× os tokens”.
Preferidos: xhigh no Opus e medium no Astra; no maestro, high ficou praticamente igual ao max. No vídeo do Opus, o max regrediu.
Tarefa delimitada de ~40 min → medium. Construção autônoma de horas, com muito material → xhigh. Quem decide é o quanto há para ler e decidir.
Os tokens de saída sobem de forma monotônica. O custo sobe 12,9× do low ao max. O orçamento é consumido de qualquer jeito.
Astra low demorou mais que medium; Opus high terminou antes do medium. Esforço baixo não garante trabalho menor.
O max do Opus fez 51 verificações e ainda teve mais glitches que o xhigh, com 34.
Astra ultra acrescentou +7,12M tokens com 3 subagentes, sem mudar o produto. O ultracode do Opus não delegou nada e se comportou como xhigh.
Houve 1 pergunta em 6 execuções. A ambiguidade precisa ser resolvida no pedido, não subindo o esforço.
O salto de “sensação” veio entre low e medium. Daí em diante, o ganho foi de interação e detalhe, o que bate com o eixo modelo × esforço do maestro.
Usar o Opus 5.5 em medium é a melhor opção para o dia a dia. Subo para high quando a tarefa pede mais raciocínio e só uso xhigh em caso extremo.
O mesmo vale para o GPT-6 Astra. O max fica de fora: nas duas fontes, ele custou mais e não entregou mais.
Esforço é orçamento de exploração, não botão de qualidade.
Comece no menor nível plausível; na dúvida, medium. Suba só com evidência de resultado insuficiente e trate max/ultra como exceção justificada. Essa regra já está no guia e no maestro-roteador.
O que este material acrescenta é um teto observado: em construção autônoma longa com Opus 5.5, o xhigh foi o melhor e o max não compensou.
avaliacao/bateria.md.