RUTA 2

📊 La evidencia

Pasar la RSI del terreno de la opinión a la medición. Esta trilha presenta las dos cifras que sustentan la alerta: la curva del horizonte de tareas de METR —cuánto tiempo de trabajo humano puede completar ya la IA por sí sola— y MirrorCode, el benchmark que pregunta cuál es el mayor software que la IA puede reconstruir a ciegas. Al terminar, podrás distinguir una tendencia sólida de una cifra por verificar.

duración de la tarea tiempo (mar. de 2024 → 2026) 4 min ~1,5 h ~12 h 16 h+ Benchmark mide el límite de la tarea
Ilustración de la Trilha 2: la curva ascendente del horizonte de tareas junto a un panel de benchmark, en azul y cian
Esta trilha tiene dos ejes: la curva (cuánto tiempo puede trabajar la IA) y el benchmark (qué tamaño de proyecto puede terminar). Juntos forman la evidencia en la que se apoya el resto de la alerta.
2
Módulos
12
Temas
~1h30
Duración
Intermedio
Nivel
Progreso de la Trilha 20 de 12 · 0%

Mapa de la ruta

Contenido detallado

2.1~45 min · 6 temas

📊 La curva METR: el horizonte de tareas

La medida que convierte «la IA está mejorando» en una cifra: el mayor trabajo, medido en tiempo humano, que un modelo termina por sí solo.

0 de 6
Qué es:

La tarea más grande —medida por el tiempo que tardaría una persona— que el modelo completa con cerca de un 50 % de éxito. Así es como METR (una organización independiente que evalúa las capacidades y los riesgos de los modelos de frontera) cuantifica «qué tan capaz» es un modelo.

Por qué aprenderlo:

Sin una regla de medición, «la IA mejoró» es una opinión. Con el horizonte de tareas, se convierte en una curva que podemos seguir mes a mes.

Conceptos clave:

METR; horizonte de tareas; tasa de éxito del 50 %; tiempo humano como unidad.

Qué es:

La secuencia de mediciones de marzo de 2024 a 2026: el horizonte pasa de unos minutos a más de media jornada de trabajo. Cada escalón es una medición de la suite, no una conjetura.

Por qué aprenderlo:

La forma de la curva es el núcleo de la alerta: no solo importa que suba, sino la velocidad a la que lo hace.

Conceptos clave:

Progresión; escalones; ritmo de crecimiento; tendencia observada.

Qué es:

La propia METR advierte que, por encima de 16 horas, las mediciones de esa suite dejaban de ser fiables. «16 h» es el techo del instrumento, no el límite del modelo.

Por qué aprenderlo:

Este es el tipo de detalle que distingue una lectura cuidadosa del gráfico de convertir una cifra en un titular engañoso.

Conceptos clave:

Límite de la prueba × límite del modelo; techo de medición; lectura honesta.

Qué es:

La auto-mejora recursiva no exige resolverlo todo al instante; exige un trabajador útil durante horas y días seguidos. Eso es precisamente un horizonte largo.

Por qué aprenderlo:

Conecta la curva con el tema del curso y prepara el terreno para MirrorCode (Módulo 2.2), donde la IA funciona durante días.

Conceptos clave:

Horizonte largo; autonomía prolongada; puente hacia la RSI.

Qué es:

Se mide ejecutando el modelo en muchas tareas de duración conocida y buscando el punto en que acierta cerca de la mitad de las veces. Hay variabilidad y, cerca del extremo superior, la prueba alcanza su propio límite.

Por qué aprenderlo:

Entender el método evita dos errores: descartar la curva como «marketing» y tratarla como si tuviera precisión de reloj.

Conceptos clave:

Tasa del 50 %; variabilidad; ruido de medición; límite de la suite.

Qué es:

Prolongar la línea del gráfico hacia el futuro no garantiza que se cumpla. La tendencia es sólida; la fecha de llegada es especulativa. No hay que confundirlas.

Por qué aprenderlo:

Esta es la postura honesta del curso: tomar en serio la evidencia sin aceptar la profecía que viene pegada a ella.

Conceptos clave:

Extrapolación; tendencia × destino; evidencia sólida frente a exageración.

Ver módulo completo
2.2~45 min · 6 temas

🪞 MirrorCode: reconstruir a ciegas

El benchmark que pregunta por la escala real: cuál es el mayor software que la IA puede reconstruir por sí sola, con solo el ejecutable y la documentación.

0 de 6
Qué es:

Un benchmark (prueba estandarizada para comparar modelos) creado por Epoch AI junto con METR. La IA recibe un programa como «caja negra» —solo el ejecutable y la documentación, sin el código fuente— y debe reconstruir el software desde cero.

Por qué aprenderlo:

Complementa la curva: no pregunta «cuánto tiempo aguanta», sino «qué tamaño de proyecto puede terminar».

Conceptos clave:

Benchmark; caja negra; reconstrucción; Epoch AI y METR.

Qué es:

La pregunta directa de la prueba: ¿cuál es el mayor software que la IA puede completar sin una persona? Son 25 programas reales: bioinformática, utilidades de Unix, criptografía e intérpretes.

Por qué aprenderlo:

«Por sí sola» y «proyecto real» son las dos expresiones que separan una demostración de una capacidad seria.

Conceptos clave:

25 programas reales; tarea de principio a fin; sin ayuda humana.

Qué es:

Un conjunto de herramientas de bioinformática con unas 16.000 líneas de Go y más de 40 comandos. La IA lo reimplementó y superó el 99,95 % de las pruebas en 14 h, por unos 251 USD; a una persona le llevaría de 2 a 17 semanas (estimación de Epoch). Las cifras vienen del video y deben verificarse.

Por qué aprenderlo:

Este ejemplo concreto vuelve tangible el benchmark y muestra por qué importa distinguir lo sólido de lo que hay que verificar.

Conceptos clave:

gotree; 99,95 % de las pruebas; estimación del esfuerzo humano; cifra por verificar.

Qué es:

Una ejecución funcionó de forma continua, sin una persona al mando, durante unos 19 días (≈ 2.600 USD). Es la curva del Módulo 2.1 hecha realidad: autonomía durante días, no minutos. Las cifras vienen del video y deben verificarse.

Por qué aprenderlo:

Muestra qué significa «horizonte largo» en la práctica y por qué es la pieza que le falta a la RSI.

Conceptos clave:

Ejecución continua; 19 días; costo de cómputo; trabajador de largo plazo.

Qué es:

El mejor modelo resuelve cerca del 56 % del benchmark: lidera, pero no sustituye a los ingenieros en todo. Un año antes, los mejores rondaban el 30 % en programas más sencillos. Nombre de versión y cifra por verificar.

Por qué aprenderlo:

El 56 % es impresionante e incompleto a la vez; considerar ambas caras es el ejercicio de este módulo.

Conceptos clave:

Tasa de resolución; liderazgo ≠ perfección; salto de ~30 % a ~56 %.

Qué es:

El concepto y el benchmark son sólidos. Las versiones exactas del modelo y las cifras concretas (251, 2.600, 56 %) proceden de una sola fuente; considéralas afirmaciones por verificar hasta consultar una fuente primaria.

Por qué aprenderlo:

La trilha concluye con un método: tomar en serio la evidencia e indicar el grado de certeza de cada cifra.

Conceptos clave:

Evidencia sólida × afirmación; fuente primaria; escepticismo productivo.

Ver módulo completo
← Trilha 1 · Fundamentos Trilha 3 · Seguridad y 2028 →