🪞 Qué es MirrorCode
El MirrorCode es una prueba creada por Epoch AI en colaboración con METR. La idea es sencilla y exigente: la IA recibe un programa terminado —solo el ejecutable y la documentación— y debe reconstruir el software desde cero sin ver nunca el código original. Después, se compara la reconstrucción con la suite de pruebas del programa real. Complementa la curva del módulo anterior: no mide «cuánto tiempo trabaja la IA», sino «qué tamaño de proyecto puede terminar».
🆕 ¿Es la primera vez que estás aquí? Dos términos antes de seguir
- Benchmark: una prueba estandarizada que todos ejecutan igual para comparar modelos de forma justa, como un examen con la misma plantilla de respuestas para todos.
- Caja negra: cuando solo tienes las entradas y salidas de un sistema (el ejecutable y la documentación), pero no no el código fuente interno. Reconstruir una caja negra consiste en observar su comportamiento y reescribir lo que lo produce.
🎯 La pregunta contundente
La pregunta detrás del benchmark es directa: ¿cuál es el mayor proyecto de software que la IA puede terminar por sí sola? «Por sí sola» y «terminar» son las palabras clave: no se trata de completar un fragmento, sino de entregar un programa que funcione de principio a fin. Para responder, MirrorCode utiliza 25 programas reales, no demostraciones de laboratorio.
Los 25 programas proceden de ámbitos distintos a propósito: un modelo bueno en uno solo no infla la puntuación. La cifra final indica «cuántos pudo resolver la IA por sí sola».
Bioinformática
herramientas que procesan datos biológicos.
Utilidades de Unix
programas clásicos de línea de comandos.
Criptografía
donde un detalle incorrecto lo arruina todo.
Intérpretes
software que ejecuta otro lenguaje.
🌳 El caso gotree
El ejemplo que le pone rostro al benchmark es gotree, un conjunto de herramientas de bioinformática. No es pequeño: unas 16.000 líneas de Go y más de 40 comandos. La IA lo reconstruyó y superó casi todas las pruebas en una fracción del tiempo y el costo que necesitaría una persona.
gotree — puntuación de reconstrucción
Las cifras son impresionantes y, precisamente por eso, deben comprobarse en una fuente primaria antes de convertirse en titulares.
💡 ¿Por qué 99,95 % y no 100 %?
Reconstruir software grande y superar casi todas las pruebas demuestra una capacidad real. Pero esa fracción que falta suele contener precisamente el caso difícil: el detalle poco común que detectaría una persona con experiencia. «Casi todo» no es «todo», y esa diferencia importa en el software que llega a producción.
⏳ La ejecución de 19 días
El dato que más conecta esta trilha con la alerta es el tiempo de ejecución: una de las ejecuciones funcionó de forma continua, sin una persona al mando, durante unos 19 días (≈ 2.600 USD en cómputo). La curva del Módulo 2.1 sale del gráfico y se vuelve práctica: no un pico de minutos, sino autonomía sostenida durante días.
Empieza la tarea
La IA recibe la caja negra y el objetivo, y empieza a trabajar sin que una persona defina cada paso.
Funciona durante días
Escribe, prueba, corrige y vuelve a intentarlo: el bucle del código se cierra miles de veces por sí solo.
Entrega al cabo de ~19 días
Lo que era un «agente que trabaja durante horas» se convierte en un «trabajador de largo plazo»: la pieza que faltaba para que la RSI fuera plausible. (Cifras del video, por verificar.)
🔗 Por qué esto importa para la alerta
La auto-mejora recursiva no necesita un genio instantáneo. Necesita un trabajador capaz de llevar proyectos de I+D que duran días. Una ejecución de 19 días sin supervisión demuestra que esa autonomía prolongada ya existe, aunque sea costosa e imperfecta.
📊 56 % de resolución
El mejor modelo resuelve cerca del 56 % de MirrorCode — lidera la clasificación, pero está lejos de una puntuación perfecta. Lo impactante es el salto: un año antes, los mejores rondaban el 30%, y en programas más sencillos. Una lectura honesta sostiene ambas ideas: es un avance grande, pero no significa que «la IA ya sustituya a los ingenieros». (El nombre de la versión y la cifra del 56 % vienen del video; por verificar.)
🆕 ¿Es la primera vez que estás aquí? «Tasa de resolución»
Es la proporción de tareas del benchmark que el modelo resuelve por completo. Una tasa del 56 % significa que terminó con éxito algo más de la mitad de todos los programas de la prueba. No significa «el 56 % de cada programa», sino «algo más de la mitad de los programas completos».
El salto en un año (cifras por verificar)
Recreación ilustrativa, no una captura de pantalla. Lo importante es la pendiente, no el decimal exacto.
✓ Lectura correcta
- ✓«La capacidad dio un gran salto en un año.»
- ✓«La IA ya termina sola más de la mitad de los proyectos reales.»
- ✓«La tendencia merece atención informada.»
✗ Lectura exagerada
- ✗«La IA ya sustituye a los ingenieros en todo.»
- ✗«El 56 % es la cifra final y definitiva.»
- ✗«El 44 % restante es un detalle menor.»
⚖️ Lo sólido frente a la exageración en MirrorCode
Cerramos esta trilha con el método del curso: el concepto y el benchmark son sólidos: existen, son públicos y miden algo real. En cambio, las cifras exactas y nombres de versiones son afirmaciones de una sola fuente: considéralas por verificar hasta contrastarlas con una fuente primaria. Confundir ambos tipos de información es el error que todo el curso intenta evitar.
🟢 Sólido (categoría real)
- ✓MirrorCode existe (Epoch AI + METR) y mide la reconstrucción de software.
- ✓La IA reconstruye proyectos reales de gran tamaño a partir de una caja negra.
- ✓La capacidad dio un salto claro en ~1 año.
- ✓La autonomía durante días (horizonte largo) ya puede demostrarse.
🟡 Por verificar (afirmación de una sola fuente)
- ⚠La cifra exacta de «56 % de tasa de resolución».
- ⚠Las cifras de gotree: 99,95 %, 14 h, 251 USD.
- ⚠Los ~19 días y los ~2.600 USD de la ejecución continua.
- ⚠Nombre y versión exactos del modelo líder.
⌨️ Ejemplo copy-run: conviértete en una persona escéptica
Objetivo: usar un chatbot para generar las preguntas que harías a la fuente primaria antes de creer las cifras; así entrenas el hábito de comprobar antes de compartir.
Cómo comprobarlo: las 5 preguntas deben cuestionar el muestreo, el costo y la definición de «por sí sola». Si son genéricas («¿es fiable?»), reescribe el prompt y pide preguntas específicas y comprobables.
Autoevaluación (opcional): en MirrorCode, ¿qué es SÓLIDO y qué HAY QUE VERIFICAR?
🎯 Resumen del módulo
Siguiente trilha:
Trilha 3 — Seguridad y 2028: qué ocurre cuando falla la propia medición y la carrera que definirá los escenarios de fin de década.