MÓDULO 2.1

📊 La curva METR: el horizonte de tareas

«La IA está mejorando» es una opinión. METR la convierte en una cifra: el mayor trabajo —medido por el tiempo que tardaría una persona— que un modelo termina por sí solo. Este módulo muestra cómo sube esa cifra, enseña a leer el gráfico con rigor y distingue la tendencia sólida de la profecía.

4 min mar. de 2024 ~1,5 h finales de 2024 ~12 h 2025 16 h+ 2026 · límite de la prueba Cada escalón es una medición real, no una conjetura. Lo que inquieta es la pendiente, no solo la altura.
6
Temas
~45
Minutos
Intermedio
Nivel
Evidencia
Tipo
Progreso del módulo0 de 6 · 0%
1

📏 ¿Qué es el «horizonte de tareas»?

Hay una forma de convertir la frase vaga «la IA está mejorando» en una cifra que podamos seguir. Esa cifra es el horizonte de tareas: la tarea más grande —medida por el tiempo que tardaría una persona en hacerla— que el modelo completa con cerca de un 50 % de éxito. Si la IA termina sola tareas que le llevarían 12 horas a una persona, decimos que su horizonte es de 12 horas.

🆕 ¿Es la primera vez que estás aquí? Tres términos antes de seguir

  • METR: una organización independiente (no es un laboratorio ni un fabricante de modelos) que evalúa las capacidades y los riesgos de los modelos de frontera — los más avanzados, de laboratorios como Anthropic, OpenAI y DeepMind. METR es quien elabora la curva.
  • Horizonte de tareas: la regla de medición: cuánto trabajo humano, medido en tiempo, puede hacer la IA de principio a fin.
  • Tasa de éxito del 50 %: el umbral. No significa «siempre acierta», sino «acierta la mitad de las veces»: el punto en que la tarea empieza a ser demasiado grande para el modelo.

🎯 Por qué medir en tiempo humano

Medir en «el tiempo que tardaría una persona» es genial porque todos entendemos esa unidad. «Resuelve el 56 % de las preguntas» no dice nada sobre el tamaño del trabajo. «Hace sola algo que te llevaría un día» lo dice todo. La curva no mide inteligencia abstracta: mide autonomía útil.

Quién mide
METR (independiente)
La medida
tiempo humano
El umbral
~50 % de éxito
Mide
autonomía, no CI
2

📈 La curva: 4 min → ~1,5 h → ~12 h → 16 h+

De marzo de 2024 a 2026, el horizonte medido por METR pasó de unos minutos y llegó a más de medio día de trabajo. La escalera en la parte superior de la página lo muestra: 4 min, luego ~1,5 h, después ~12 h y finalmente 16 h+. Lo importante no es cada escalón por separado, sino la pendiente: la medida se duplica en intervalos cortos.

tareas cortas tareas largas → horizonte (~50 % de aciertos) acierto error

Cómo leerlo: a la izquierda (tareas cortas), casi todo son aciertos; a la derecha (tareas largas), casi todo son errores. La línea discontinua señala dónde la IA acierta la mitad de las veces: ese punto, medido en tiempo humano, es el horizonte.

💡 Consejo de lectura

No memorices las cifras; memoriza la forma. Una curva que se duplica cada pocos meses es exponencial, y el crecimiento exponencial engaña a la intuición, que espera líneas rectas. Por eso el horizonte pasó «de repente» de minutos a horas.

3

🧱 16 h fue el límite de la PRUEBA, no del modelo

Aquí está el error de lectura más común. La propia METR advirtió que, por encima de 16 horas, las mediciones de esa suite dejaban de ser fiables. Es decir, «16 h» es el techo del instrumento —hasta dónde puede medir bien la prueba—, no la frontera de lo que el modelo es capaz de hacer.

⚠️ Cuidado con el titular

Interpretar «16 h» como «el máximo que puede hacer la IA» contradice los datos. Puede que el modelo llegue más lejos; esta prueba no permite afirmarlo. Tomar un techo de medición como límite de capacidad es como decir que un coche solo alcanza 200 km/h porque hasta ahí llega el velocímetro.

✓ Lectura honesta

  • ✓«La prueba mide bien hasta ~16 h.»
  • ✓«La tendencia sigue subiendo.»
  • ✓«Necesitamos mejores pruebas por encima de ese límite.»

✗ Lectura engañosa

  • ✗«La IA se detiene a las 16 h.»
  • ✗«Ese es el límite definitivo.»
  • ✗«Llegó al límite, ya podemos relajarnos.»
4

⏱️ Por qué el horizonte largo importa para la RSI

La auto-mejora recursiva (RSI) —la IA que ayuda a diseñar la siguiente IA— no requiere un genio que lo resuelva todo al instante. Requiere un trabajador útil durante horas y días seguidos: que mantenga el hilo del problema, ejecute experimentos, espere los resultados y continúe. Por eso el horizonte largo (horizonte largo) es la pieza que conecta esta trilha con toda la alerta.

Horizonte corto × horizonte largo

⏱️
Corto: responder una pregunta, escribir una función, corregir un error. Es útil, pero son tareas aisladas.
⏳
Largo: llevar adelante un proyecto entero durante días: planificar, ejecutar, probar y ajustar. Eso es lo que hace un «ingeniero de IA» y lo que la RSI necesita automatizar.

🔗 El puente hacia el siguiente módulo

Quédate con esta idea: si la IA ya puede trabajar de forma continua durante horas, la siguiente pregunta es: «qué tamaño del proyecto puede terminar por sí sola?». Eso es precisamente lo que mide MirrorCode, y ahí veremos una ejecución que funciona durante días sin una persona (Módulo 2.2).

La RSI necesita
autonomía durante días
No necesita
un genio instantáneo
La curva muestra
que eso se acerca
Siguiente
tamaño del proyecto
5

🔬 Cómo se mide (y por qué es difícil)

Se mide así: se reúnen muchas tareas de duración conocida (se sabe cuánto tardaría una persona en cada una), se ejecuta el modelo en todas y se busca la duración en que acierta cerca de la mitad de las veces. Ese punto es el horizonte. Es fácil de explicar, pero difícil de medir bien, por tres motivos.

1

Variabilidad

La misma tarea puede salir bien en una ejecución y fallar en otra. Por eso se ejecuta muchas veces y se usan promedios, no una sola prueba.

2

Estimar el tiempo humano

¿Cuántas horas de trabajo humano «vale» una tarea? Es una estimación, y las estimaciones tienen un margen de error. Dos evaluadores pueden discrepar.

3

La prueba alcanza su propio límite

Cerca del extremo superior (las 16 h del Tema 3), faltan tareas lo bastante largas y bien medidas. El instrumento se queda corto antes que el modelo.

⌨️ Ejemplo copy-run · percibe el horizonte en tu propio trabajo

Objetivo: entrenar la mirada para distinguir tareas de horizonte corto y largo a partir de tu jornada. Pega el bloque siguiente en cualquier chatbot.

Enumera 5 tareas que hago en <mi trabajo; cambia esto> y estima cuánto tardaría una persona en cada una. Después, indica si un agente de IA podría hacerla HOY SOLO durante horas seguidas y qué seguiría requiriendo a una persona al mando. Distingue entre «horizonte corto» y «horizonte largo».

Cómo comprobarlo: la respuesta debe distinguir las tareas de minutos (horizonte corto) de las de horas o días (horizonte largo), no limitarse a decir «la IA lo hace todo». Si no distingue ambas, vuelve a pedirlo.

6

🧭 Lo que la curva NO demuestra

La curva es una prueba sólida de una tendencia. No demuestra un destino. Prolongar la línea del gráfico y afirmar que «pronto la IA hará tareas que duran meses» es cambiar medición por profecía. La postura honesta del curso es tomar en serio los datos e indicar dónde terminan y dónde empieza la especulación.

🟢 Sólido (lo respalda la curva)

  • ✓El horizonte de tareas ha aumentado de forma constante.
  • ✓Entre 2024 y 2026, pasó de minutos a más de medio día.
  • ✓METR es una fuente independiente con un método transparente.

🟡 Por verificar / especulación

  • ▲«La línea sigue igual y llega a tareas de semanas.»
  • ▲Una fecha exacta en que el horizonte superará X horas.
  • ▲Que el ritmo actual está garantizado para el futuro.

💡 La regla de oro del curso

Tendencia observada = sólida. Fecha de llegada = conjetura. Cuando alguien combine ambas en una frase, sepáralas antes de creerlo. La curva dice «está subiendo rápido», no «llegará en tal año».

Ilustración del Módulo 2.1: la curva ascendente del horizonte de tareas sube en escalones de minutos a horas, en azul y cian sobre un fondo oscuro
La imagen repite la idea central: cada escalón es un aumento medido de capacidad, no imaginado. Fíjate en la pendiente: es lo que sustenta la alerta, no cada cifra por separado.

Autoevaluación (opcional): ¿qué significan las «16 horas» en la curva de METR?

🎯 Resumen del módulo

✓
Horizonte de tareas — la tarea más grande, medida en tiempo humano, que la IA completa con ~50 % de éxito.
✓
La curva — de 4 min a más de 16 h entre 2024 y 2026; lo que inquieta es la pendiente.
✓
16 h = límite de la prueba — el techo del instrumento, no del modelo.
✓
Horizonte largo y RSI — la RSI necesita un trabajador útil durante días, no un genio instantáneo.
✓
Cómo se mide — tasa de éxito del 50 %, variabilidad y una prueba que alcanza su propio límite.
✓
Lo que NO demuestra — la tendencia es sólida; la fecha de llegada es especulativa.

Próximo módulo:

2.2 — MirrorCode: reconstruir a ciegas. De «cuánto tiempo aguanta» a «qué tamaño de proyecto puede terminar por sí sola».