En esta página
Revisión del productor — primeros intentos
La revisión terminó el 7 de septiembre de 2026, hora de Toronto (8 de septiembre en UTC). Los siete primeros intentos se congelaron antes de las pruebas del productor. No se enviaron correcciones ni orientaciones a los participantes. Los archivos fuente originales no se editaron. Los servidores se reiniciaron para la revisión; varias inicializaciones simultáneas chocaron en los puertos de inspección y luego funcionaron en secuencia. El tiempo de reinicio no se incluye en la duración de los participantes.
Esta es la traducción de la revisión histórica, no una nueva ejecución de las pruebas. La versión en inglés está en ../original-en/evidence/PRODUCER-CHECKS.md.
Medición
Tiempo: el primero task_complete.duration_ms de cada tarea, redondeado al segundo más cercano. Incluye la espera de herramientas, la investigación y la construcción, no solo la generación del modelo. Las siete ejecuciones se realizaron simultáneamente en la misma máquina; compara las ejecuciones observadas, no una velocidad universal.
Tokens: total_token_usage acumulado final en la primera conclusión, conciliado de forma independiente con la suma de last_token_usage de las distintas actualizaciones acumuladas. Las siete concuerdan. total = input + output; reasoning_output es un subconjunto de output, e cached_input es un subconjunto de input. No sumes ninguno dos veces. Ultra incluye el principal y tres totales de tareas hijas, cada uno limitado al momento en que finaliza el principal. Los contadores de las tareas hijas comienzan de forma independiente cerca de 30 mil, sin heredar el acumulado del principal. La suma es 21.730.368. Son tokens procesados, en su mayoría entrada en caché o reutilizada, no contexto nuevo, créditos, dinero ni cargos.
Fuente primaria: results.json; se conservaron los hashes de las sesiones de origen. Las cantidades exactas y los enlaces sin procesar y normalizados están en ese archivo. XHIGH contiene ocho URL de publicaciones o conversaciones, pero solo siete conversaciones: el segundo estado de X es una respuesta del autor en la misma conversación. Las demás coinciden con el recuento de conversaciones identificado en el registro. Se volvió a abrir una fuente original de Reddit de Low y Medium; la fuente de Medium realmente describe habitaciones, escaleras y conductos adicionales fuera del alcance acordado. Las cantidades miden la extensión del registro de investigación, no una demanda de compra validada.
Cuadros: elementos nativos activos y no excluidos de Excalidraw. Las imágenes incorporadas se contaron en los archivos; los dibujos y las formas no cuentan como imágenes incorporadas. Los siete JSON de los tableros son válidos; se leyeron sus textos para comprobar las seis zonas exigidas y las conexiones entre evidencias, decisiones de producto, recorrido, pantallas, arquitectura y MVP. Sol separa la dirección visual como una zona adicional y no incorpora imágenes rasterizadas. Los conteos son descriptivos, no calificaciones de calidad.
LOW · Astra / Clearshift
En el navegador, el productor abrió CS-1042, editó la instrucción de corrección, guardó la asignación y cargó una nueva verificación de ejemplo. El cierre quedó deshabilitado hasta comprobar el patrón señalado. Tras completarlo y recargar, el panel mostró Open 2 y Closed 1. Aprobado en este flujo de corrección, nueva verificación y guardado.
Ocho conversaciones en Reddit; ninguna en X. El tablero tiene 161 elementos y tres capturas reales de la aplicación. El flujo delimitado del dueño es coherente, con alternativas explícitas y una ventaja de servicio/datos propuesta. Más tiempo y tokens procesados registrados que Medium, a pesar del menor esfuerzo.
MED · Astra / Scopewell
En el navegador, en una verificación anterior que se conservó, el productor cambió la mano de obra de 45 a 60 minutos; la propuesta mensual pasó de $164 a $212. Preparó la propuesta, registró una aceptación ficticia y recargó: se conservó un cambio registrado y $212 en adicionales. Aprobado en cambio de precio, aprobación y persistencia.
Seis conversaciones en Reddit; ninguna en X. El cuadro tiene 133 elementos y un boceto de interfaz incorporado. Evidencias contrarias detalladas, un competidor de pago establecido, utilidad desde el primer día y un plan de refutación. Es el cuadro con menos elementos, no el de mayor profundidad visual. Menor tiempo de finalización registrado y menos tokens procesados que Low y High. El autor lo recomienda como punto de partida para esta tarea de investigación y construcción porque ofreció suficiente funcionalidad verificada en menos tiempo.
HIGH · Astra / Fieldwork
En el navegador, el productor marcó Cedar como no disponible. Redujo la hora máxima de finalización de Emma a 10:00, lo que produjo “No feasible cover”. Restauró las 12:00 y eligió Elm 09:00–11:00 y Birch 14:15–16:15. Revisó los dos borradores modificados y los guardó. Tras recargar, Cedar quedó vacío, Emma en Elm y Priya en Birch; las otras cuatro visitas no cambiaron. Aprobado en validación de restricciones, redistribución y persistencia.
Siete fuentes de Reddit y una de X. El cuadro tiene 186 elementos y tres capturas de la aplicación. Un problema de programación más profundo que un formulario simple; los horarios condicionales reales y un estado sin solución viable aportan profundidad relevante. Margen fijo para desplazamientos, sin optimización de rutas en tiempo real.
XHIGH · Astra / Scopekeep
En el navegador, el productor cambió la tarifa de mano de obra de $95 a $110 por tres horas; el total pasó a $530. Usó una respuesta ficticia, registró la aprobación y preparó la facturación. Tras recargar, había una línea de $530 lista para facturar, en la revisión 1. Aprobado en recálculo, aprobación, facturación y persistencia.
Seis conversaciones en Reddit y una en X, después de quitar la respuesta duplicada. Cuadro con 155 elementos y un visual incorporado. Contraejemplo contundente: un dueño de una empresa de techado dice que Grok y el software abierto Slowbooks ya generan solicitudes de cambio de servicio; esto cuestiona directamente el negocio propuesto. El intento del productor de acceder a X falló, así que la fuente sigue identificada como leída por el participante, sin una nueva verificación independiente en esta revisión. Es una distinción editorial sobre la profundidad del negocio, no una clasificación factual universal.
MAX · Astra / Fieldnote
En el navegador, el productor cambió la mano de obra a $275,25 y los materiales a $84,75. La vista previa mostró exactamente $360. La aprobación simulada se conservó tras recargar; los adicionales aprobados de Morgan pasaron a $840 y el total del servicio a $25.640. Aprobado en precio exacto, aprobación y persistencia.
Siete fuentes de Reddit, ninguna de X. Cuadro con 155 elementos nativos y tres capturas de la aplicación. El modelo creado incluye validación de transiciones de estado, centavos exactos y eliminación de la aprobación anterior en las revisiones rechazadas. El participante detectó que Escape cerraba el cuadro, lo corrigió y volvió a probarlo. El evento de descarga no fue verificado por el participante; existe una alternativa de exportación seleccionable. Mayor duración registrada, 46:10, por encima del límite autogestionado de 45 minutos, incluido el empaquetado.
HIGH · Sol / RelayOps
En el navegador, el productor seleccionó “Split with Crew 1” (11 minutos adicionales de desplazamiento) y luego “Prepare updates”. El resumen todavía decía “Move Fernbank” y “Brief Crew 2”, correspondientes a la opción de compresión. Ingresó un mensaje personalizado para el cliente y simuló las actualizaciones; el resultado mostró valores fijos de 0 minutos de desplazamiento y 3/3 compromisos. Al recargar, se conservó el estado resuelto.
Resultado parcial: la progresión entre etapas y la persistencia funcionaron; el plan seleccionado no determina el resumen ni la salida posterior. Se confirmaron los JSX de cambio y resultado con valores fijos en app/page.tsx, líneas 115 y 118. La instrucción histórica era no corregir antes de filmar.
Seis enlaces de Reddit y dos de X. Cuadro con 215 elementos, diagramas vectoriales de pantallas y ninguna imagen incorporada. El breve registro de investigación, con 369 palabras, cuenta con respaldo en el contenido de la aplicación y el cuadro; no uses solo el tamaño del archivo para clasificar la profundidad. Menor total de tokens procesados, segundo menor tiempo. La conexión más débil entre la decisión y la salida entre las rutas verificadas.
ULTRA · Astra / Accord
En el navegador, el productor creó un nuevo cambio personalizado para el acabado de una despensa: 2 horas a $85 más $30 dieron como resultado $200. Creó una solicitud pendiente; la aprobación quedó deshabilitada hasta ingresar una nota. Ingresó una aprobación ficticia y la registró; tras recargar, el título, el alcance, los $200 y la nota de aprobación se conservaron sin cambios. Aprobado en nuevo registro, cálculo, aprobación y persistencia.
Siete conversaciones en Reddit y dos en X. Cuadro con 240 elementos, dos imágenes incorporadas y seis zonas principales. Tres subagentes Ultra investigaron Reddit, X y las alternativas; luego, especialistas en investigación y alternativas auditaron la implementación y los casos numéricos extremos. El análisis de los competidores incluyó solicitudes de cambio limitadas a facturas en Joist y el comportamiento de nueva aprobación en Jobber, más allá de las afirmaciones de marketing. La mejor aplicación en este caso para delegar frentes separados de investigación y verificación; procesó más trabajo que Medium, sin un equipo de modelos más baratos. El total incluye 7,12 millones de tokens de los agentes secundarios.
Cómo interpretar la recomendación
Elige una configuración inicial para una tarea acotada de investigación y prototipado. Medium: menor tiempo observado con una ruta funcional verificada por el productor y un plan conectado adecuado. High: siguiente prueba útil cuando hay restricciones que interactúan. Ultra: experimento independiente de delegación, con investigación especializada más profunda. Sol: menor uso de procesamiento, pero un fallo concreto en la salida condicional.
No hay una clasificación universal de modelos ni conclusiones sobre precios. Ningún participante necesitó un recordatorio del productor para devolver los artefactos; esto no demuestra que todas las tareas estén libres de interrupciones tempranas.