MÓDULO 2.2

🪞 MirrorCode: reconstruir a ciegas

Si la curva del Módulo 2.1 mide cuánto tiempo puede trabajar la IA, MirrorCode mide qué tamaño de proyecto puede terminar. La prueba es exigente: a la IA solo se le entrega el programa terminado y la documentación, nunca el código fuente, y se le pide reconstruir todo el software. Aquí verás las cifras y aprenderás a distinguir lo sólido de lo que debe verificarse.

Caja negra ejecutable + documentación (sin código fuente) la IA reconstruye Código reconstruido módulo funciones comandos / API ¿supera las pruebas? Suite de pruebas original mide el % de comportamiento idéntico La puntuación no indica si «parece correcto»: mide cuánto se comporta el software reconstruido como el original.
6
Temas
~45
Minutos
Intermedio
Nivel
Evidencia
Tipo
Progreso del módulo0 de 6 · 0%
1

🪞 Qué es MirrorCode

El MirrorCode es una prueba creada por Epoch AI en colaboración con METR. La idea es sencilla y exigente: la IA recibe un programa terminado —solo el ejecutable y la documentación— y debe reconstruir el software desde cero sin ver nunca el código original. Después, se compara la reconstrucción con la suite de pruebas del programa real. Complementa la curva del módulo anterior: no mide «cuánto tiempo trabaja la IA», sino «qué tamaño de proyecto puede terminar».

🆕 ¿Es la primera vez que estás aquí? Dos términos antes de seguir

  • Benchmark: una prueba estandarizada que todos ejecutan igual para comparar modelos de forma justa, como un examen con la misma plantilla de respuestas para todos.
  • Caja negra: cuando solo tienes las entradas y salidas de un sistema (el ejecutable y la documentación), pero no no el código fuente interno. Reconstruir una caja negra consiste en observar su comportamiento y reescribir lo que lo produce.
Quién lo creó
Epoch AI + METR
Entrada
ejecutable + documentación
Tarea
reconstruir desde cero
Puntuación
% de pruebas superadas
2

🎯 La pregunta contundente

La pregunta detrás del benchmark es directa: ¿cuál es el mayor proyecto de software que la IA puede terminar por sí sola? «Por sí sola» y «terminar» son las palabras clave: no se trata de completar un fragmento, sino de entregar un programa que funcione de principio a fin. Para responder, MirrorCode utiliza 25 programas reales, no demostraciones de laboratorio.

La pregunta ¿puede terminar sola? bioinformática utilidades de Unix criptografía intérpretes … 25 en total Puntuación cuántos terminó

Los 25 programas proceden de ámbitos distintos a propósito: un modelo bueno en uno solo no infla la puntuación. La cifra final indica «cuántos pudo resolver la IA por sí sola».

🧬

Bioinformática

herramientas que procesan datos biológicos.

🐧

Utilidades de Unix

programas clásicos de línea de comandos.

🔐

Criptografía

donde un detalle incorrecto lo arruina todo.

⚙️

Intérpretes

software que ejecuta otro lenguaje.

3

🌳 El caso gotree

El ejemplo que le pone rostro al benchmark es gotree, un conjunto de herramientas de bioinformática. No es pequeño: unas 16.000 líneas de Go y más de 40 comandos. La IA lo reconstruyó y superó casi todas las pruebas en una fracción del tiempo y el costo que necesitaría una persona.

gotree — puntuación de reconstrucción

lenguaje: Go · ~16.000 líneas · más de 40 comandos
pruebas_superadas: 99,95% (según el video; pendiente de verificar)
tiempo_de_IA: ~14 h (según el video; pendiente de verificar)
costo: ~251 USD (según el video; pendiente de verificar)
estimación_humana: 2 a 17 semanas (Epoch — por verificar)

Las cifras son impresionantes y, precisamente por eso, deben comprobarse en una fuente primaria antes de convertirse en titulares.

💡 ¿Por qué 99,95 % y no 100 %?

Reconstruir software grande y superar casi todas las pruebas demuestra una capacidad real. Pero esa fracción que falta suele contener precisamente el caso difícil: el detalle poco común que detectaría una persona con experiencia. «Casi todo» no es «todo», y esa diferencia importa en el software que llega a producción.

4

⏳ La ejecución de 19 días

El dato que más conecta esta trilha con la alerta es el tiempo de ejecución: una de las ejecuciones funcionó de forma continua, sin una persona al mando, durante unos 19 días (≈ 2.600 USD en cómputo). La curva del Módulo 2.1 sale del gráfico y se vuelve práctica: no un pico de minutos, sino autonomía sostenida durante días.

1

Empieza la tarea

La IA recibe la caja negra y el objetivo, y empieza a trabajar sin que una persona defina cada paso.

2

Funciona durante días

Escribe, prueba, corrige y vuelve a intentarlo: el bucle del código se cierra miles de veces por sí solo.

3

Entrega al cabo de ~19 días

Lo que era un «agente que trabaja durante horas» se convierte en un «trabajador de largo plazo»: la pieza que faltaba para que la RSI fuera plausible. (Cifras del video, por verificar.)

🔗 Por qué esto importa para la alerta

La auto-mejora recursiva no necesita un genio instantáneo. Necesita un trabajador capaz de llevar proyectos de I+D que duran días. Una ejecución de 19 días sin supervisión demuestra que esa autonomía prolongada ya existe, aunque sea costosa e imperfecta.

5

📊 56 % de resolución

El mejor modelo resuelve cerca del 56 % de MirrorCode — lidera la clasificación, pero está lejos de una puntuación perfecta. Lo impactante es el salto: un año antes, los mejores rondaban el 30%, y en programas más sencillos. Una lectura honesta sostiene ambas ideas: es un avance grande, pero no significa que «la IA ya sustituya a los ingenieros». (El nombre de la versión y la cifra del 56 % vienen del video; por verificar.)

🆕 ¿Es la primera vez que estás aquí? «Tasa de resolución»

Es la proporción de tareas del benchmark que el modelo resuelve por completo. Una tasa del 56 % significa que terminó con éxito algo más de la mitad de todos los programas de la prueba. No significa «el 56 % de cada programa», sino «algo más de la mitad de los programas completos».

El salto en un año (cifras por verificar)

un año antes · programas sencillos~30%
ahora · 25 programas reales~56%

Recreación ilustrativa, no una captura de pantalla. Lo importante es la pendiente, no el decimal exacto.

✓ Lectura correcta

  • ✓«La capacidad dio un gran salto en un año.»
  • ✓«La IA ya termina sola más de la mitad de los proyectos reales.»
  • ✓«La tendencia merece atención informada.»

✗ Lectura exagerada

  • ✗«La IA ya sustituye a los ingenieros en todo.»
  • ✗«El 56 % es la cifra final y definitiva.»
  • ✗«El 44 % restante es un detalle menor.»
6

⚖️ Lo sólido frente a la exageración en MirrorCode

Cerramos esta trilha con el método del curso: el concepto y el benchmark son sólidos: existen, son públicos y miden algo real. En cambio, las cifras exactas y nombres de versiones son afirmaciones de una sola fuente: considéralas por verificar hasta contrastarlas con una fuente primaria. Confundir ambos tipos de información es el error que todo el curso intenta evitar.

🟢 Sólido (categoría real)

  • ✓MirrorCode existe (Epoch AI + METR) y mide la reconstrucción de software.
  • ✓La IA reconstruye proyectos reales de gran tamaño a partir de una caja negra.
  • ✓La capacidad dio un salto claro en ~1 año.
  • ✓La autonomía durante días (horizonte largo) ya puede demostrarse.

🟡 Por verificar (afirmación de una sola fuente)

  • ⚠La cifra exacta de «56 % de tasa de resolución».
  • ⚠Las cifras de gotree: 99,95 %, 14 h, 251 USD.
  • ⚠Los ~19 días y los ~2.600 USD de la ejecución continua.
  • ⚠Nombre y versión exactos del modelo líder.

⌨️ Ejemplo copy-run: conviértete en una persona escéptica

Objetivo: usar un chatbot para generar las preguntas que harías a la fuente primaria antes de creer las cifras; así entrenas el hábito de comprobar antes de compartir.

Eres una persona rigurosamente escéptica. A partir de este resumen del benchmark MirrorCode: <pega aquí el resumen que leíste; sustituye esto> Enumera 5 preguntas que debería hacer a la FUENTE PRIMARIA antes de creer las cifras. Céntrate en cómo se seleccionó la muestra, qué significa exactamente que «la IA lo terminó por sí sola», el costo real de cómputo y qué tienen en común el 44 % de los casos fallidos.

Cómo comprobarlo: las 5 preguntas deben cuestionar el muestreo, el costo y la definición de «por sí sola». Si son genéricas («¿es fiable?»), reescribe el prompt y pide preguntas específicas y comprobables.

Autoevaluación (opcional): en MirrorCode, ¿qué es SÓLIDO y qué HAY QUE VERIFICAR?

🎯 Resumen del módulo

✓
MirrorCode — benchmark de Epoch AI + METR: reconstruir software a partir de una caja negra.
✓
La pregunta contundente — cuál es el mayor proyecto que la IA termina por sí sola; 25 programas reales.
✓
El caso gotree — ~16.000 líneas reconstruidas, 99,95 % de las pruebas (cifras por verificar).
✓
19 días seguidos — autonomía durante días: la curva del módulo 2.1 hecha práctica.
✓
56 % de resolución — lidera y da un gran salto, pero no sustituye a los ingenieros en todos los ámbitos.
✓
Lo sólido frente al hype — el concepto y el benchmark son sólidos; las cifras y versiones deben verificarse.

Siguiente trilha:

Trilha 3 — Seguridad y 2028: qué ocurre cuando falla la propia medición y la carrera que definirá los escenarios de fin de década.

Ilustración: una IA reconstruye software a partir de una caja negra, en azul y cian sobre un fondo oscuro cuadriculado
MirrorCode consiste en «reconstruir a ciegas»: la IA solo ve el comportamiento externo (la caja negra) y debe recrear el sistema por dentro. Cuanto mayor sea el proyecto que termine por sí sola, más se parecerá a un trabajador de I+D: la capacidad que esta alerta llama RSI.