Referencia · 24/09/2026

Esfuerzo en la práctica

Dos experimentos ejecutaron el mismo pedido en todos los niveles de esfuerzo: uno con Claude Opus 5.5 y otro con GPT-6 Astra. Los dos muestran el mismo patrón: el nivel máximo nunca fue el preferido.

Esta página es una referencia: no cambia el stack ni las reglas de la guía. Son datos de terceros, con una ejecución por nivel y el juicio de una persona. Fuentes en texto: padroes-esforco · video Opus 5.5 · astra-effort.
Fuente A · Claude Opus 5.5

La misma app 3D en seis niveles

Tarea: un /goal largo que convierte ~105 GB de grabaciones de un evento virtual en una conferencia 3D explorable. El autor prefirió xhigh (“Extra” en el video). Max costó el doble y tuvo más bugs.

12,9×
costo de max respecto a low
2,3×
aumento de checks en el mismo intervalo
1 / 6
ejecuciones que hicieron alguna pregunta (0 usaron subagente)

Cuánto crece cada métrica (low = 1×)

Costo y tiempo se disparan; los checks casi no se mueven.

Ver tabla
NivelTokensCostoTiempoChecks
low1,001,001,001,00
medium2,193,184,371,05
high2,934,174,011,00
xhigh ★3,796,635,381,55
max6,1812,888,852,32
ultracode—4,785,681,91

Costo estimado por nivel (US$)

Estimación a precio de API; el autor lo ejecutó con suscripción. Destacado: el preferido.

Ver tabla
NivelTiempoCostoTokensChecksPreguntas
low16m43s3,91191k220
medium1h13m12,44419k230
high1h07m16,31~559k221
xhigh ★1h30m25,92~723k340
max2h28m50,381,18M510
ultracode1h35m18,69?420

~ = número dicho de forma truncada en el video. Los tokens de ultracode se dijeron como “66 mil”, lo que no cuadra con 1h35m de ejecución; quedan como desconocidos.

low → medium

Mayor salto percibido: marca correcta, videos reales reproduciéndose, stands y área VIP.

high → xhigh

Ganancia de interacción: hablar con personajes, sentarse en las charlas, abrir recursos.

xhigh → max

2× el costo y +1h de ejecución, con caminata mala, glitches y un video que no se reproducía. Retrocedió.

Fuente B · GPT-6 Astra

Investigación + micro-SaaS en siete condiciones

Datos del kit traducido en astra-effort: la misma tarea de investigación y construcción, de 30 a 46 minutos. El autor prefirió medium, que fue el más rápido y aun así entregó el flujo verificado. Sol high y Astra ultra (con 3 subagentes) aparecen como condiciones aparte.

Tiempo por condición (minutos)

Low tardó más que medium. Un esfuerzo bajo no garantiza menos trabajo.

Tokens de salida (miles)

Siempre sube con el esfuerzo. El presupuesto de razonamiento se gasta con o sin retorno.

Ver tabla
CondiciónTiempoTokens procesadosTokens de salidaNota del productor
low37m37s14,81M51,5kmás tiempo y tokens que medium
medium ★30m41s10,23M42,2kpreferido: flujo verificado en el menor tiempo
high41m21s14,33M57,4kbueno con restricciones que interactúan
xhigh45m14s12,29M67,7kencontró evidencia contra su propia idea
max46m10s10,55M70,2kel más largo; precisión en valores y reglas
ultra (3 hijos)42m10s21,73M96,0k+7,12M de los hijos; producto parecido
Sol high32m49s6,70M54,2kbarato, pero con un camino de decisión roto

Los tokens procesados incluyen ~98% de entrada en caché y no representan costo. No los compares con los tokens de la Fuente A en valor absoluto: compara solo la forma de las curvas.

Cruzando las fuentes

Ocho patrones

Incluye la Fuente C, una prueba interna registrada en maestro-roteador: de high a max, “la diferencia fue un favicon, por 2–5× los tokens”.

El máximo nunca fue el preferido

Preferidos: xhigh en Opus y medium en Astra; en maestro, high quedó prácticamente igual a max. En el video de Opus, max retrocedió.

El punto ideal cambia con la tarea

Tarea acotada de ~40 min → medium. Construcción autónoma de horas, con mucho material → xhigh. Lo que decide es cuánto hay para leer y decidir.

El razonamiento siempre se gasta; el retorno no siempre llega

Los tokens de salida suben de forma monótona. El costo sube 12,9× de low a max. El presupuesto se consume de todos modos.

El costo total no es lineal

Astra low tardó más que medium; Opus high terminó antes que medium. Un esfuerzo bajo no garantiza menos trabajo.

Más checks no significan menos bugs

El max de Opus hizo 51 verificaciones y aun así tuvo más glitches que xhigh, con 34.

La delegación es otra condición

Astra ultra sumó +7,12M tokens con 3 subagentes, sin cambiar el producto. El ultracode de Opus no delegó nada y se comportó como xhigh.

El esfuerzo no compra preguntas

Hubo 1 pregunta en 6 ejecuciones. La ambigüedad se resuelve en el pedido, no subiendo el esfuerzo.

El esfuerzo compra deliberación, no gusto

El salto de “sensación” llegó entre low y medium. De ahí en adelante, la ganancia fue de interacción y detalle, lo que coincide con el eje modelo × esfuerzo del maestro.

🧭 Opinión de Nei: cómo uso el esfuerzo

medium · por defecto→high · cuando haga falta más razonamiento→xhigh · casos extremos

Usar Opus 5.5 en medium es la mejor opción para el día a día. Subo a high cuando la tarea pide más razonamiento y solo uso xhigh en casos extremos.

Lo mismo vale para GPT-6 Astra. Max queda fuera: en las dos fuentes costó más y no entregó más.

⚖️ Conclusión

El esfuerzo es un presupuesto de exploración, no un botón de calidad.

Empieza en el nivel más bajo plausible; ante la duda, medium. Sube solo con evidencia de un resultado insuficiente y trata max/ultra como una excepción justificada. Esta regla ya está en la guía y en maestro-roteador.

Lo que este material añade es un techo observado: en construcción autónoma larga con Opus 5.5, xhigh fue el mejor y max no compensó.

Límites de los datos

  • Una ejecución por nivel en cada fuente; la variación entre ejecuciones no se midió.
  • Juicio visual de una persona. La Fuente A tiene patrocinador; la Fuente B se tradujo sin nueva ejecución.
  • Los costos de la Fuente A son estimaciones a precio de API.
  • Todavía no hay una prueba propia de INEMA. Para hacer una, usa avaliacao/bateria.md.