Probé todos los niveles de esfuerzo de GPT-6 Astra. Esto es lo que usaría — YouTube
https://www.youtube.com/watch?v=OQipTxv9Qv0
Transcripción traducida al portugués. Las opiniones y aproximaciones numéricas son del narrador. La transcripción automática original está en original-en/docs/transcricao-video.txt; nombres evidentes como “GBT6”, “Astro”, “Soul” y “Excel draw” se normalizaron a GPT-6, Astra, Sol y Excalidraw. Para consultar los números exactos y los límites metodológicos, revisa SUPER-GUIDE.md y evidence/results.json.
(00:00) GPT-6 Astra está disponible desde hace algún tiempo, y uno de los debates más importantes en YouTube y en X es este: ¿qué nivel de esfuerzo ofrece la mejor relación entre valor y costo con este modelo? También vi a personas decir que es perezoso por naturaleza.
(00:17) Hace lo que le pides, pero nada más, y a veces ni siquiera eso. Así que hice algunos experimentos para ver si cambiar el esfuerzo también cambiaba ese comportamiento. Probé todos los niveles de Astra en el mismo proyecto de investigación y construcción, e incluí Sol en la comparación. En este video, te mostraré qué entregó cada uno, cuánto tardó, cuántos tokens consumió y si el esfuerzo tuvo alguna influencia.
(00:42) Al final, podrás evaluar qué nivel se adapta a tus proyectos cotidianos. Empecemos. Esta publicación en X fue la razón por la que quise hacer la prueba. Tibo lidera los productos principales de OpenAI y también es conocido por parecer reiniciar su cuota de uso cada hora. Hizo una afirmación atrevida.
(01:00) GPT-6 Astra en Low tiene un mejor rendimiento que GPT-6 Sol en High. Sol es el modelo anterior y está siendo olvidado por esta novedad. Pero, para muchos objetivos y tareas, sigue siendo más que suficiente. Cuando investigas experiencias reales y comentarios sobre este modelo, especialmente en Low, escuchas que se detiene demasiado pronto y pide permiso cada cinco minutos.
(01:26) Quería evaluar dos cosas: ¿un esfuerzo extra necesariamente mejora los resultados? ¿Y ofrece más autonomía, haciendo que el modelo deje de pedir permiso y de parecer perezoso? En la documentación oficial de OpenAI, encontramos lo siguiente.
(01:42) El modelo fue diseñado para colaborar mejor y, por eso, tiende a hacer más preguntas al usuario. La documentación también dice que esto puede hacer que se detenga cuando el usuario esperaba que hiciera suposiciones razonables. Algo como Fable 5.1 es muy bueno cuando le das una visión general, un resumen del objetivo, y no solo extrapola, sino que añade pasos que considera adecuados.
(02:06) Parece que Astra, al menos en algunos niveles de esfuerzo, quizá no haga eso tan bien. Para que el experimento fuera lo más transparente y equilibrado posible, controlé seis variables: el mismo contexto, el mismo acceso a herramientas, MCP y skills, el mismo alcance de construcción y las mismas condiciones. Y separé Ultra porque con frecuencia crea una serie de subagentes.
(02:29) Te mostraré un pequeño truco para abrir varias conversaciones con distintos niveles de esfuerzo usando el mismo prompt. Y, por último, registramos cuántos tokens y cuánto tiempo consumió cada conversación. Este fue el prompt que enviamos a las siete conversaciones; te lo explicaré por partes.
(02:47) La idea central era permitir que cada agente investigara todo lo posible en X y Reddit, dos excelentes lugares para escuchar los comentarios de los usuarios. El cliente objetivo era este: encontrar una oportunidad de SaaS que valga la pena para dueños de pequeñas empresas de servicios con 2 a 20 empleados.
(03:07) No elegí la categoría, el problema ni el producto. Empieza por los problemas, considera tres oportunidades y elige una. Para las evidencias, pedimos investigar en estas plataformas y analizar tres alternativas existentes a la idea inicial. El objetivo era reunir frustraciones recurrentes, soluciones improvisadas, señales de gasto y evidencias en contra.
(03:29) Esta es la frase más importante del prompt para evaluar la oportunidad: supón que los clientes y los competidores pueden usar Astra para reproducir rápidamente un software competente. Es decir, no construyas un SaaS que se pueda hacer con vibe coding en un fin de semana. Idealmente, el modelo de negocio debe tener alguna ventaja defendible.
(03:47) Para la planificación, quería que creara sus propios archivos de Excalidraw usando IA para generar los JSON correspondientes. Con modelos más avanzados, ya no necesito una skill: puedo pedir un archivo de Excalidraw. Es un formato que permite hacer anotaciones y crear diagramas como si los hubiera dibujado a mano.
(04:08) En vez de una skill, quería que cada nivel demostrara la creación del archivo completo para observar cómo organizaba el razonamiento. Para el producto principal, quería un sitio bien terminado, parecido a los sitios que preparo para explicar estos conceptos en YouTube.
(04:26) Quería un sitio de ChatGPT que explicara el plan completo de construcción después de la investigación. Además del sitio y del archivo de Excalidraw, quería un prototipo funcional del SaaS. Dividir la tarea en estas partes daría espacio para que cada nivel mostrara diferencias reales, si las había.
(04:48) Las preguntas centrales eran: ¿podemos seguir la justificación de por qué es una buena idea? ¿Por qué alguien pagaría? ¿Se conectan las piezas: el perfil elegido, el problema señalado y sus evidencias, el producto? ¿Funciona el flujo? ¿Tiene sentido que exista como SaaS? Y, en cuanto a la conclusión, ¿terminó y verificó su trabajo? ¿Reflexionó sobre lo que pasó? Estas son todas las conversaciones que ejecutamos.
(05:17) Mentiría si dijera que las abrí todas manualmente. Basta con pedirle a Codex una serie de conversaciones y solicitarle que las nombre según el nivel de esfuerzo, cambie el esfuerzo y las vincule a una carpeta específica. Puedes pedir algo así.
(05:38) Quiero que uses el mismo prompt; puedes crearlo. Debe ser una tarea muy sencilla. Crea tres conversaciones separadas, con nombres fáciles de leer en la barra lateral, cada una con un nivel de Astra: Low, Medium y High. Ejecuta este prompt en las tres al mismo tiempo, ahora.
(05:58) Y sigue el progreso de cada una. Es una función reciente que está disponible tanto en Claude como en Codex. Al abrir los elementos recientes, vemos que las nuevas conversaciones de prueba empiezan a aparecer por separado. Ahí están.
(06:17) Ahora tenemos Astra Medium, Low y High, todos en ejecución. Al entrar, vemos la misma tarea. Así puedes empezar a probar a escala. El resultado de cada conversación fue un tablero como este, un sitio, un análisis completo y las estadísticas de tokens, tiempo y resultado principal.
(06:39) Astra en Low tardó 37 minutos, consumió casi 15 millones de tokens, revisó ocho conversaciones de Reddit y ninguna de X, y creó 161 elementos en el tablero. Esto no mide necesariamente la calidad; muestra cuánto trabajo produjo. El producto registra las tareas de limpieza pendientes hasta que se corrigen y se vuelven a verificar, para dueños de empresas de limpieza comercial que atienden oficinas con regularidad.
(07:03) La ventaja propuesta son los patrones específicos de cada cliente y el historial de correcciones que funcionaron. Interesante. El sitio quedó así. No estamos evaluando la belleza, sino el concepto central. Es el borrador de este SaaS. No impresiona mucho, pero quizá sea un negocio viable.
(07:23) La gran carencia es que no hay evidencias de X, y no fue más allá de lo que se le pidió. Astra Medium tardó apenas 30 minutos, consumió 10 millones de tokens y revisó seis conversaciones en Reddit. El producto calcula los precios de servicios de limpieza adicionales y registra si el cliente los acepta, para empresas con contratos por escrito.
(07:42) La ventaja propuesta son registros precisos del alcance y estimaciones mejoradas con los servicios reales. No sé cuánto sea una ventaja defendible. Lo interesante es que otra vez estamos en el sector de la limpieza, aunque no lo especifiqué. Quizá, dadas el perfil y el alcance proporcionados, y todas las condiciones, este parezca el mejor sector.
(08:02) El sitio es parecido. Al explorar el plan y abrir el tablero, la división parece más clara: cliente, alternativas, oportunidad y recorrido del dueño. Hay un buen análisis de las consecuencias. Tendría que leerlo todo para evaluar el modelo de negocio en detalle, pero la calidad y variedad de los análisis parecen mejores que en Low, con menos tiempo y tokens.
(08:31) Astra High tardó cerca de 40 minutos y consumió 14 millones de tokens. Buscó en Reddit y, por fin, encontró una publicación o un conjunto de publicaciones en X, y creó el tablero más detallado. La idea fue redistribuir las visitas cuando un equipo de limpieza no puede trabajar.
(08:50) Quizá sea la descripción más sencilla hasta ahora: para dueños de empresas de limpieza residencial que coordinan equipos y horarios. La ventaja propuesta son las restricciones específicas de la empresa y los resultados que mejoran la programación. Hasta ahora, el sitio es el más claro en cuanto a la visión y el problema. El problema aparece aquí.
(09:09) A las 7:42, la camioneta de Cedar no arranca. Hay dos visitas recurrentes que necesitan cobertura; tenemos que llenar horarios que se cancelarían. La idea busca reducir los ingresos perdidos. Pero ¿valió la pena dedicarle 40 minutos y 14 millones de tokens, o se podría llegar al mismo punto usando los 30 minutos de Medium y un prompt más preciso, o con un seguimiento? Extra High tardó 45 minutos, pero consumió un poco menos que High: 12 millones.
(09:40) Lo interesante, y la razón por la que digo que esto no es AGI y considero exageradas muchas de estas afirmaciones, es que el nivel de esfuerzo debería corresponder de alguna manera con la eficiencia, pero no es así. High estuvo cerca de los 14 millones de tokens.
(09:59) Low estuvo cerca de los 15 millones y Medium, de los 10 millones. Hay variación e imprevisibilidad. Si lo repitiera, diría que probablemente los tiempos serían parecidos, pero el consumo de tokens es cada vez más imprevisible.
(10:16) Esta vez el negocio no es de limpieza. Lleva los trabajos adicionales de remodelación desde la aprobación hasta la facturación, para pequeños empresarios que pierden el control de lo que deben cobrar. La ventaja propuesta son verificaciones del alcance personalizadas según el historial de aprobación, facturación y pago. Una descripción larga. El sitio parece del nivel de High, pero empeora cuando lo examinas por dentro.
(10:39) Tiene un diseño parecido y cuatro pestañas similares. El tablero vinculado se abre en una nueva pestaña, un efecto agradable. Hay filtros y botones para navegar. Pero, en alcance y apariencia, el tablero parece un poco peor que el de High. Esta era la versión High.
(11:01) También tiene botones, en otra posición y un poco más juntos, y más evidencias para cada afirmación. Al hacer clic en las evidencias de los clientes, vas directamente a la conversación asociada. Hay una mejor división y más fuentes vinculadas a las conversaciones exactas. Al compararlas lado a lado, la versión Extra High es más sencilla y menos detallada.
(11:29) Tiene menos referencias y una navegación un poco mejor. Fuera de eso, no veo un beneficio adicional por los cinco o diez minutos extra y los posibles tokens más allá de Medium y High. Max me confundió: tardó 46 minutos, pero consumió apenas 10 millones de tokens.
(11:50) Fue eficiente en tokens, pero un poco ineficiente en tiempo para llegar a ese consumo. La idea mantiene el alcance, el precio y la aprobación de los servicios adicionales en un registro. Parece orientada a bases de datos u organización de datos, para dueños de empresas de remodelación residencial con equipos de 2 a 10 personas.
(12:09) La ventaja propuesta es una rutina adoptada en la obra, configuración asistida y recomendaciones de profesionales contables. Interesante: piensa en un negocio impulsado por recomendaciones. Quiero destacar que, incluso en Max, no hay referencias a X, aunque sí aparecieron en High.
(12:27) Otra evidencia de que gastar más tokens —o, en este caso, más tiempo para procesarlos— no necesariamente mejora el resultado. El sitio está más limpio y mejor terminado. Parece un producto real en comparación con High y Extra High. Transmite la visión y el problema que intentamos resolver.
(12:49) Pero ¿dedicarías diez minutos adicionales en vez de añadir uno o dos prompts a un nivel inferior? Llegamos a Astra Ultra: 42 minutos, menos que Max, pero nada menos que 22 millones de tokens para este resultado. Esto es lo que obtienes con 22 millones de tokens.
(13:10) Registra y combina los trabajos adicionales de remodelación antes de que empiece el trabajo. Básicamente automatiza las solicitudes de cambios en los servicios para pequeños empresarios de remodelación residencial que gestionan extras con frecuencia. La ventaja propuesta es una configuración específica de cada especialidad y una rutina comprobada, mejorada con resultados reales. El sitio no es una obra maestra de Da Vinci.
(13:29) Se parece mucho a los anteriores, con pequeños cambios de espaciado y acabado que no aportan mucho a la experiencia. Al explorar la oportunidad, hay un botón con relieve y un tablero casi idéntico al que ya vimos.
(13:47) Hay dos fuentes en una posición extraña: un conjunto adicional de fuentes por bloque. ¿Vale la pena el tiempo y los tokens adicionales? Veinte millones de tokens y subagentes para armar esto. Como comparación de control, también probamos Sol High porque, según la publicación de Tibo, Astra Low debería ofrecer una experiencia equivalente. Sol tardó solo 32 minutos.
(14:12) Apenas 6 millones de tokens. Si te olvidaste de Sol, hay motivos para recordarlo. Astra no debería usarse para todo. No hace falta llevar una bomba nuclear a cada pelea a puñetazos. Sorprendentemente, buscó en seis conversaciones de Reddit y dos de X. La cantidad no representa necesariamente la calidad, pero al menos consultó esas fuentes.
(14:36) El plan de negocio organiza la recuperación cuando los retrasos afectan una ruta de servicios, muy parecido al anterior. El público objetivo son dueños que también coordinan las operaciones de empresas de servicios recurrentes con 2 a 20 empleados. La ventaja son los resultados de recuperación, reglas mantenidas y soporte responsable. Espero que el sitio no sea tan bonito, pero que sea funcional.
(14:56) Bien, esto es increíblemente feo; es tan malo que dan ganas de cerrar los ojos o entrecerrarlos. Creo que la primera imagen intenta mostrar un diagrama del modelo de negocio. Puedo decir sin problema que Astra es mucho mejor para crear sitios y generar rápidamente este tipo de sitio de ChatGPT.
(15:17) Pero la pregunta real es: ¿se podría usar una skill que creara un sitio bonito, con el espaciado adecuado, y seguir usando Sol High o Medium? Por el experimento y por mi uso diario, me encanta Astra Medium en Fast. Es mi configuración favorita entre las versiones de los modelos de Codex. Es rápida.
(15:37) No consume tokens a un ritmo alarmante y es bastante eficiente. En este experimento encontré lo mismo: el sitio, la estructura, el plan de negocio, el modelo de negocio y el tablero parecían muy similares entre Medium y High.
(15:53) Si quieres un poco más de calidad, puedes usar High y gastar algunos tokens adicionales. Pero, para la mayoría de las tareas diarias, si quieres Astra —aunque no deberías usarlo para todo—, Medium es más que suficiente. Espero que esto te ayude a entender qué nivel de esfuerzo puede servirte.
(16:12) Según esta prueba y otras que hice, veo pocos casos en los que Max, Extra High o Ultra valgan el tiempo, el esfuerzo o los tokens adicionales. Hice muchas otras pruebas y documenté hallazgos, información adicional y consejos sobre cuándo usar distintos niveles para ciertos tipos de tareas.
(16:34) Voy a poner esto a tu disposición en el segundo enlace de la descripción. Puedes descargarlo gratis, dárselo a Codex o Claude y pedirle una explicación. Y, como siempre, si quieres estar al día en IA, especialmente en su aplicación práctica en el trabajo, en los negocios, para aprender o ganar dinero, revisa el primer enlace de abajo.
(16:57) Profundizo bastante en temas como este en la comunidad Early AI Dopters. Si te gustó y te pareció útil, agradecería que le dieras Me gusta al video —ayuda a que llegue a más personas— y que dejaras un comentario, si quieres. Nos vemos en el próximo.