🔁 El ciclo de feedback rápido
En el software, el ciclo de trabajo es muy corto: escribes, ejecutas, compruebas si pasó y vuelves a intentarlo —y ocurre en segundos. Este «ciclo de feedback rápido» es el ingrediente secreto: cuanto más corto el ciclo, más intentos caben por hora y más rápido aprende a mejorar algo (o alguien).
🧭 ¿Es la primera vez? Un término
Ciclo de feedback: un ciclo en el que haces algo, recibes una señal clara de si funcionó o no y la usas para ajustar el siguiente intento. En el código, la señal es objetiva (la prueba pasó o falló) e inmediata; por eso el ciclo es tan potente.
⚡ Ciclo corto = aprendizaje rápido
Imagina a alguien aprendiendo a jugar a los dardos con los ojos vendados: si solo sabe dónde acertó al final del día, mejora despacio. Si ve cada acierto en el momento, mejora rápido. El código ofrece ese feedback inmediato; por eso la IA mejora más rápido en este ámbito.
🧪 Software frente a biología/química
¿Por qué la auto-mejora empieza por el código y no por la medicina o la química? Porque el tamaño del ciclo es diferente. En el mundo físico, un experimento (un cultivo celular, una reacción, un material nuevo) tarda semanas o meses en dar resultados. En el software, la misma «ronda experimental» termina en segundos.
El mismo número de «intentos», pero con tiempos opuestos. Por eso la IA que se mejora a sí misma aparece primero en el código: caben miles de experimentos en el tiempo que la biología necesita para uno.
Por qué el código va primero
- ✓Resultado objetivo e inmediato (pasó/falló).
- ✓Costo muy bajo por intento.
- ✓Se pueden ejecutar miles de intentos en paralelo.
Por qué el mundo físico tarda más
- ✗Un experimento tarda días, semanas o meses.
- ✗Cada intento requiere materiales y un laboratorio.
- ✗No se puede paralelizar de forma económica como el código.
🤖 Agentes de código que funcionan solos
El bucle de retroalimentación solo se convierte en RSI cuando algo lo ejecuta sin una persona en cada paso. Ahí entran los agentes: una IA que escribe código, lo ejecuta, lee el error, lo corrige y vuelve a intentarlo por su cuenta, una y otra vez, durante horas.
🧭 ¿Es la primera vez? Un término
Agente: una IA que ejecuta pasos por su cuenta en lugar de limitarse a responder una pregunta. Puede ejecutar código, editar un archivo, leer el resultado y decidir el siguiente paso, cerrando el ciclo «proponer → probar → corregir» sin que tengas que pulsar Enter cada vez.
Escribe
Propone una solución en código a partir del objetivo.
Ejecuta y lee el error
Lo ejecuta, ve el mensaje de error y entiende qué falló.
Corrige y repite
Hace un ajuste, vuelve a ejecutarlo y sigue hasta que pase, sin esperarte.
Copy-run: comprueba cómo se cierra el bucle
Objetivo: ver cómo un chatbot recorre «proponer → probar → corregir» con un ejemplo mínimo. Pega el prompt en cualquier chatbot.
Escribe una función en Python que reciba una lista de números y devuelva el promedio. Luego EJECÚTALA mentalmente con la lista [2, 4, 6], muestra el resultado paso a paso, encuentra un error y corrígelo, mostrando la versión final corregida.
Cómo comprobarlo: una buena respuesta realmente la «ejecuta» mentalmente (muestra la suma 12, divide entre 3 y obtiene 4), señala un error real (por ejemplo, dividir entre cero si la lista está vacía) y ofrece la corrección. Si solo dice que «se ve bien» sin probar ni encontrar errores, el bucle no se cerró: acabas de ver la diferencia entre responder e iterar.
🧫 Agentes evolutivos
Un paso más allá del agente individual: ¿y si ejecutas muchos a la vez? El agente evolutivo propone varios cambios en paralelo, prueba cada uno, conserva el ganador y parte de él para la siguiente ronda, buscando soluciones más rápido de lo que podrían hacerlo las personas. La categoría está bien establecida; el nombre exacto citado en el video («agente evolutivo guiado por Gemini») es una afirmación de un canal (pendiente de verificar).
Cómo leerlo: a la izquierda se lanzan muchos intentos (en cian, en paralelo); las pruebas filtran; a la derecha se conserva solo el mejor, y esa variante ganadora se convierte en la «idea base» de la siguiente ronda. Es el bucle rápido de retroalimentación multiplicado.
✅ Sólido (la categoría)
- ✓La búsqueda evolutiva (proponer → probar → seleccionar) es una técnica real y antigua.
- ✓La IA ya se usa para optimizar código y algoritmos.
⚠️ Por verificar (la afirmación)
- !El nombre o producto exacto («guiado por Gemini») viene del video; comprueba la fuente.
- !«Más rápido que las personas» depende de la tarea; no es una regla general.
🏢 Dentro de Anthropic
El ejemplo más concreto de RSI «suave» en funcionamiento hoy viene de la propia Anthropic. La empresa afirma públicamente que la mayor parte del código que se incorpora al producto pasa por Claude. El video cita cifras específicas —útiles para dimensionar, pero deben tratarse como afirmaciones hasta consultar una fuente primaria.
🧭 ¿Es la primera vez? Un término
Hacer merge (merge): incorporar oficialmente un fragmento de código nuevo al programa principal. El «código fusionado» es el que realmente se aceptó y se incorporó al producto, no un borrador.
✅ Qué está bien establecido aquí
Lo sólido no es el porcentaje exacto, sino que Anthropic afirma públicamente que la mayor parte del código pasa por Claude. Ese es el bucle «suave» en funcionamiento dentro de un laboratorio de frontera: la IA ya es una herramienta central que ayuda a construir la propia IA.
⚖️ El papel de las personas cambia
La pregunta inevitable: «Entonces, ¿desaparece el programador?». La respuesta honesta es no: el papel cambia de naturaleza. En lugar de escribir cada línea, la persona dirige, revisa y decide qué importa. No es «la persona fuera del bucle», sino «la persona por encima del bucle».
✗ Interpretación equivocada
- ✗«Se eliminó a las personas y la IA lo hace todo sola.»
- ✗«Ya no hace falta entender lo que se está haciendo.»
- ✗«Revisar es opcional.»
✓ Interpretación correcta
- ✓La persona dirige: define el objetivo y los criterios.
- ✓La persona revisa: juzga si el resultado sirve.
- ✓La persona decide qué importa y se hace responsable de ello.
💡 El puente hacia la Trilha 2
«La persona por encima del bucle» solo funciona si podemos medir lo que hacen los sistemas. Ahí entra la Trilha 2: la curva METR (cuánto tiempo de trabajo puede sostener un modelo) y MirrorCode (reconstruir software a ciegas), las cifras que vuelven concreta esta conversación.
Autoevaluación (opcional): ¿por qué la auto-mejora aparece primero en el código?
🎯 Resumen del módulo
Siguiente trilha:
Trilha 2 — La evidencia: la curva METR (horizonte de tareas) y MirrorCode. Las cifras que concretan la alerta.