Dos experimentos ejecutaron el mismo pedido en todos los niveles de esfuerzo: uno con Claude Opus 5.5 y otro con GPT-6 Astra. Los dos muestran el mismo patrón: el nivel máximo nunca fue el preferido.
Tarea: un /goal largo que convierte ~105 GB de grabaciones de un evento virtual en una conferencia 3D explorable. El autor prefirió xhigh (“Extra” en el video). Max costó el doble y tuvo más bugs.
Costo y tiempo se disparan; los checks casi no se mueven.
| Nivel | Tokens | Costo | Tiempo | Checks |
|---|---|---|---|---|
| low | 1,00 | 1,00 | 1,00 | 1,00 |
| medium | 2,19 | 3,18 | 4,37 | 1,05 |
| high | 2,93 | 4,17 | 4,01 | 1,00 |
| xhigh ★ | 3,79 | 6,63 | 5,38 | 1,55 |
| max | 6,18 | 12,88 | 8,85 | 2,32 |
| ultracode | — | 4,78 | 5,68 | 1,91 |
Estimación a precio de API; el autor lo ejecutó con suscripción. Destacado: el preferido.
| Nivel | Tiempo | Costo | Tokens | Checks | Preguntas |
|---|---|---|---|---|---|
| low | 16m43s | 3,91 | 191k | 22 | 0 |
| medium | 1h13m | 12,44 | 419k | 23 | 0 |
| high | 1h07m | 16,31 | ~559k | 22 | 1 |
| xhigh ★ | 1h30m | 25,92 | ~723k | 34 | 0 |
| max | 2h28m | 50,38 | 1,18M | 51 | 0 |
| ultracode | 1h35m | 18,69 | ? | 42 | 0 |
~ = número dicho de forma truncada en el video. Los tokens de ultracode se dijeron como “66 mil”, lo que no cuadra con 1h35m de ejecución; quedan como desconocidos.
Mayor salto percibido: marca correcta, videos reales reproduciéndose, stands y área VIP.
Ganancia de interacción: hablar con personajes, sentarse en las charlas, abrir recursos.
2× el costo y +1h de ejecución, con caminata mala, glitches y un video que no se reproducía. Retrocedió.
Datos del kit traducido en astra-effort: la misma tarea de investigación y construcción, de 30 a 46 minutos. El autor prefirió medium, que fue el más rápido y aun así entregó el flujo verificado. Sol high y Astra ultra (con 3 subagentes) aparecen como condiciones aparte.
Low tardó más que medium. Un esfuerzo bajo no garantiza menos trabajo.
Siempre sube con el esfuerzo. El presupuesto de razonamiento se gasta con o sin retorno.
| Condición | Tiempo | Tokens procesados | Tokens de salida | Nota del productor |
|---|---|---|---|---|
| low | 37m37s | 14,81M | 51,5k | más tiempo y tokens que medium |
| medium ★ | 30m41s | 10,23M | 42,2k | preferido: flujo verificado en el menor tiempo |
| high | 41m21s | 14,33M | 57,4k | bueno con restricciones que interactúan |
| xhigh | 45m14s | 12,29M | 67,7k | encontró evidencia contra su propia idea |
| max | 46m10s | 10,55M | 70,2k | el más largo; precisión en valores y reglas |
| ultra (3 hijos) | 42m10s | 21,73M | 96,0k | +7,12M de los hijos; producto parecido |
| Sol high | 32m49s | 6,70M | 54,2k | barato, pero con un camino de decisión roto |
Los tokens procesados incluyen ~98% de entrada en caché y no representan costo. No los compares con los tokens de la Fuente A en valor absoluto: compara solo la forma de las curvas.
Incluye la Fuente C, una prueba interna registrada en maestro-roteador: de high a max, “la diferencia fue un favicon, por 2–5× los tokens”.
Preferidos: xhigh en Opus y medium en Astra; en maestro, high quedó prácticamente igual a max. En el video de Opus, max retrocedió.
Tarea acotada de ~40 min → medium. Construcción autónoma de horas, con mucho material → xhigh. Lo que decide es cuánto hay para leer y decidir.
Los tokens de salida suben de forma monótona. El costo sube 12,9× de low a max. El presupuesto se consume de todos modos.
Astra low tardó más que medium; Opus high terminó antes que medium. Un esfuerzo bajo no garantiza menos trabajo.
El max de Opus hizo 51 verificaciones y aun así tuvo más glitches que xhigh, con 34.
Astra ultra sumó +7,12M tokens con 3 subagentes, sin cambiar el producto. El ultracode de Opus no delegó nada y se comportó como xhigh.
Hubo 1 pregunta en 6 ejecuciones. La ambigüedad se resuelve en el pedido, no subiendo el esfuerzo.
El salto de “sensación” llegó entre low y medium. De ahí en adelante, la ganancia fue de interacción y detalle, lo que coincide con el eje modelo × esfuerzo del maestro.
Usar Opus 5.5 en medium es la mejor opción para el día a día. Subo a high cuando la tarea pide más razonamiento y solo uso xhigh en casos extremos.
Lo mismo vale para GPT-6 Astra. Max queda fuera: en las dos fuentes costó más y no entregó más.
El esfuerzo es un presupuesto de exploración, no un botón de calidad.
Empieza en el nivel más bajo plausible; ante la duda, medium. Sube solo con evidencia de un resultado insuficiente y trata max/ultra como una excepción justificada. Esta regla ya está en la guía y en maestro-roteador.
Lo que este material añade es un techo observado: en construcción autónoma larga con Opus 5.5, xhigh fue el mejor y max no compensó.
avaliacao/bateria.md.