⚙️ De chatbot a agente: cuando la IA empieza a actuar
Un chatbot responde. Un agente hace. En este módulo entenderás la diferencia más importante de todo el curso: el momento en que la IA deja de ser una cajita que devuelve texto y empieza a usar herramientas, en un ciclo, para cambiar el mundo de verdad: enviar un correo electrónico, leer tu agenda, terminar una tarea por sí sola.
🚀 El salto: de responder a hacer
En los módulos 1.1 y 1.2 viste el cerebro: el LLM, ese programa entrenado con mucho texto que predice la siguiente palabra. Por sí solo, es brillante y completamente atado: solo sabe hacer una cosa: producir texto. Preguntas y responde. Como una persona genial encerrada en un cuarto blanco, sin ventanas, teléfono ni manos. Conversa muy bien, pero no puede tocar nada del exterior.
El salto de este módulo, y la frontera entre un chatbot y un Jarvis — y darle a esa persona un teléfono, un teclado y una puerta. De repente, ya no solo habla de programar una reunión: abre tu agenda y programa. Ese "hacer cosas en el mundo" tiene un nombre: agente.
🧭 La definición que te llevarás para todo el curso
Uno agente no es un modelo «más inteligente». Es el mismo LLM, que gana dos cosas:
- •Herramientas — medios para actuar en el mundo real (buscar en la web, leer un archivo, enviar un mensaje).
- •Un ciclo — la libertad de usar estas herramientas en secuencia, decidiendo el siguiente paso en cada ronda, hasta terminar la tarea.
En una frase: agente = LLM + herramientas + un loop que decide qué hacer a continuación.
✗ Chatbot — solo RESPONDE
- ✗"Aquí tienes un modelo de correo electrónico que puedes enviar..."
- ✗Devuelve texto y se detiene. El trabajo real queda en tus manos.
- ✗No ve tu agenda ni accede a tus archivos.
- ✗Toda acción depende de que copies, pegues y hagas clic.
✓ Agente — ACTÚA en el mundo
- ✓«Listo, envié el correo a Ana y agendé la llamada de las 15h.»
- ✓Ejecuta la tarea de principio a fin y te avisa del resultado.
- ✓Lee tu agenda, busca en la web, abre archivos — con permiso.
- ✓Delegas; él hace los pasos por su cuenta.
¿Eres nuevo aquí? Chatbot = un programa de IA que solo intercambia mensajes contigo (ChatGPT en pantalla es el ejemplo clásico). Agente = una IA que, además de conversar, puede ejecutar acciones usando herramientas, en un ciclo, hasta completar una tarea. La diferencia no es «ser más inteligente» — es tener manos e a libertad de usarlas en secuencia.
Conceptos clave
IA que solo conversa: tú preguntas, responde y listo.
LLM + herramientas + un loop: además de hablar, actúa.
La marca del agente: cambiar algo de verdad (correo, agenda, archivo).
Dejas de pedir respuestas y empiezas a delegar tareas.
🔁 El ciclo agéntico
El corazón de un agente es un ciclo sencillo, repetido hasta que termina la tarea. Lo llamamos bucle agéntico. En vez de una sola respuesta, el agente funciona en ciclos: en cada uno piensa, quizá usa una herramienta, lee lo que recibió y decide el siguiente paso. Cuando ya tiene lo que necesita, se detiene y te responde.
En verde, el razonamiento del modelo; en cian, la parte que interactúa con el mundo (la herramienta). La flecha discontinua es la bucle: el agente vuelve a pensar tantas veces como haga falta, limitado por un límite de iteraciones para no girar para siempre.
📊 Un ejemplo concreto: "¿cuál es el pronóstico para mañana en Salvador?"
- 1.Piensa: "No sé el pronóstico de hoy: necesito buscarlo."
- 2.Llama a la herramienta de búsqueda web con «pronóstico Salvador mañana».
- 3.Lee el resultado: "27°C, chubascos por la tarde".
- 4.Decide: "Ya tengo lo que necesito." Detiene el bucle y responde con el pronóstico.
Si faltara algo (por ejemplo, confirmar la ciudad), daría otra vuelta. Este ida y vuelta es lo que distingue a un agente de una respuesta única.
⚠️ Por qué existe el límite de iteraciones
Sin un límite, un agente confundido puede entrar en un bucle infinito —buscando, volviendo a leer, buscando de nuevo— y, en la nube, gastando dinero en cada vuelta. Por eso, todo sistema serio establece un límite (p. ej.: «máximo 10 vueltas»). Es un cinturón de seguridad: es mejor que se detenga y diga «no lo logré» a que se ejecute sin fin. Volveremos a esto en Anatomía (Ruta 3) y en «Operar» (Ruta 4).
Conceptos clave
Piensa → llama a la herramienta → lee → decide → repite o responde.
Una vuelta del ciclo. El agente puede dar varias.
Límite de vueltas para evitar bucles infinitos y gastos descontrolados.
"Ya tengo lo que necesitaba": el agente decide cuándo terminó.
🤲 Herramientas (tools) = las manos
Si el loop es el ciclo, las herramientas (en inglés, tools) son lo que le da poder a cada vuelta. Una herramienta es simplemente una acción que el agente puede solicitar: buscar en la web, ejecutar un fragmento de código, leer un archivo, enviar un mensaje, consultar tu agenda. Son las manos y los ojos de Jarvis.
Hay una frase que resume bien por qué esto importa: sin herramientas, el modelo "responde como un extraño". No sabe nada de ti: no ha visto tu agenda, no ha leído tus correos ni conoce tus archivos. Da consejos genéricos. Con herramientas, accede a los tus datos reales y se convierte en un asistente de verdad.
🔧 Cómo el agente «solicita» una herramienta (tool calling)
El modelo no ejecuta nada por su cuenta: no sabe abrir un navegador. Lo que hace es pedir: genera un texto estructurado que dice "quiero usar la herramienta buscar_web con el término predicción de Salvador". El sistema que lo rodea (tu Jarvis) es quien realmente ejecuta, obtiene el resultado y se lo devuelve al modelo en la siguiente vuelta del bucle. Este mecanismo tiene un nombre: tool calling (o function calling — «llamada de función»).
Piensa en el modelo como un jefe que da órdenes y en un asistente (el sistema) que sale a ejecutarlas. El jefe nunca toca las herramientas: decide cuáles usar y cuando.
Ejemplos de herramientas comunes
Buscar en la web
Resuelve el «no sabe cosas recientes»: trae noticias, precios y el pronóstico de hoy.
Leer / escribir archivos
Abrir un documento tuyo, resumirlo, guardar una nota. Jarvis empieza a trabajar con TU material.
Ejecutar código
Hacer un cálculo exacto, generar un gráfico, automatizar algo. (Poder fuerte — requiere cuidado; lo veremos en la T4.)
Enviar mensaje / agenda
Enviar un correo electrónico, programar un evento, avisarte por Telegram. Aquí la IA realmente ACTÚA en el mundo.
¿Eres nuevo aquí? Herramienta / tool = una acción aislada que el agente puede activar. Tool calling (o function calling) = el mecanismo mediante el cual el modelo "pide" una herramienta en vez de ejecutarla directamente. Más adelante (Trilha 3) verás el MCP, un estándar que conecta herramientas con cualquier agente de forma segura: el «USB de las herramientas de IA».
Conceptos clave
Una acción que el agente puede solicitar: buscar, leer, enviar, ejecutar.
El modelo PIDE la acción; el sistema la EJECUTA y devuelve el resultado.
Sin herramientas, el modelo solo da consejos genéricos; no ve tus datos.
La metáfora: las herramientas le dan cuerpo al cerebro que solo hablaba.
🧠 La metáfora LLM-OS (Karpathy)
En septiembre de 2023, Andrej Karpathy — uno de los investigadores de IA más influyentes, ex-OpenAI y ex-Tesla, propuso una imagen que cambió la forma en que toda la industria piensa en el tema. La idea: el LLM no es «solo un chatbot». Es el kernel de un nuevo sistema operativo. Karpathy llamó a esto LLM-OS.
¿Eres nuevo aquí? O kernel y es el núcleo de un sistema operativo (como Windows o Android): la parte central que coordina todo: la memoria, los programas, los periféricos (impresora, pantalla, teclado). Decir que «el LLM es el kernel de un SO de IA» es decir que es el corazón coordinador de un sistema nuevo, con el agente al mando de las piezas que lo rodean.
La fuerza de la metáfora está en las correspondencias. Cada pieza de una computadora común tiene un equivalente en el mundo del agente — y ya conociste todas en los módulos anteriores y en este:
En el centro, en verde, el LLM como kernel (el coordinador). En cian, las piezas que controla: la ventana de contexto hace el papel de la RAM (memoria de trabajo del módulo 1.2), las herramientas son los periféricos, y los agentes son los procesos. El mismo diseño de siempre; solo cambian los nombres.
🗺️ La tabla de traducción
- •LLM → o kernel (el núcleo que coordina todo).
- •Ventana de contexto → a RAM (memoria de trabajo, limitada, se vacía al cerrar — lo viste en el módulo 1.2).
- •Herramientas → los periféricos (teclado, pantalla, impresora: lo que interactúa con el mundo).
- •Agentes / subtareas → los procesos (trabajos que se ejecutan y se coordinan).
¿Por qué esto te importa a ti, que no eres experto? Porque esta metáfora se convirtió en el modelo mental de toda la industria. Cuando alguien habla de «Agentic OS» o «Sistema Operativo de IA» —incluso en el título de este curso—, está usando la idea de Karpathy. No necesitas construir nada ahora; basta con que guardes esta imagen: el LLM coordina la memoria, las herramientas y las tareas, como un SO coordina una computadora.
Conceptos clave
La metáfora de Karpathy (2023): el LLM como kernel de un nuevo SO.
El núcleo coordinador de un sistema operativo.
La memoria de trabajo del modelo, equivalente a la RAM.
El «Agentic OS» que adoptó toda la industria (y este curso).
🌐 AIOS, Operator, Project Jarvis
La metáfora de Karpathy no se quedó en el papel. En pocos años, se convirtió en un producto y una investigación de verdad. Vale la pena conocer tres ejemplos —no para usarlos ahora, sino para notar que "agente" y "SO de IA" son la dirección real hacia la que se dirigen las mayores empresas y laboratorios.
AIOS: el kernel se convirtió en paper
COLM 2025Los investigadores construyeron un kernel real para agentes de IA: un sistema que organiza varios agentes ejecutándose al mismo tiempo, con un planificador (quién se ejecuta y cuándo), memoria y almacenamiento — exactamente las piezas de un SO. Resultado: hasta 2,1× más rápido. La metáfora «LLM-OS» dejó de ser solo una imagen y se convirtió en un sistema medido.
OpenAI Operator
OpenAIUn agente que usa la computadora como un humano: él ve la pantalla, mueve el cursor, hace clic y escribe para realizar tareas en el navegador (reservar, comprar, completar formularios). Es el loop agéntico con una herramienta poderosa: la propia pantalla de la computadora.
Google Project Jarvis
GoogleSí, «Jarvis», tal cual. Un agente de Google que navega el navegador Chrome por ti — leyendo la estructura de la página y ejecutando pasos (buscar, comparar, completar). El nombre no es casualidad: la fantasía de la película se convirtió en una línea de productos.
🧩 El hilo que conecta los tres
Fíjate: AIOS, Operator y Project Jarvis son la misma idea de este módulo en distintas escalas. Todos son agentes: LLM + herramientas + ciclo. AIOS organiza muchos agentes (el lado del «sistema operativo»); Operator y Project Jarvis le dan al agente la herramienta más amplia posible (toda la computadora). No necesitarás ninguno de ellos para tener tu Jarvis: a lo largo del curso armaremos una versión ligera, propia y segura. Pero es bueno saber que estás en el mismo camino que las grandes empresas.
¿Eres nuevo aquí? AIOS = "Sistema operativo de IA", un sistema de investigación que sirve como kernel para varios agentes. Operator (OpenAI) y Project Jarvis (Google) son agentes que controlan la computadora o el navegador "mirando" la pantalla. Paper = artículo científico; COLM y una conferencia académica sobre modelos de lenguaje. No necesitas memorizarlo: basta con saber que la idea de agente está en el centro de la industria.
Conceptos clave
Kernel de investigación para coordinar varios agentes (2,1× más rápido).
Agente de OpenAI que ve la pantalla y usa la computadora como una persona.
Agente de Google que navega Chrome por ti.
Todos son LLM + herramientas + loop —lo que acabas de aprender.
🪄 Qué cambia para ti
Toda la teoría de este módulo se traduce en un cambio práctico y muy concreto en tu día a día: dejas de preguntar y empieza a delegar. Es un cambio de actitud: de «ayúdame a pensar en esto» a «resuélvelo por mí y avísame».
✗ Antes: TÚ PREGUNTAS
- ✗"Dame ideas para el asunto de un correo electrónico de cobro."
- ✗Todavía escribes, abres Gmail, copias, pegas y envías.
- ✗La IA es un consejero; el trabajo manual sigue siendo tuyo.
✓ Después: TÚ DELEGAS
- ✓"Cobra al cliente X la factura vencida y confírmame. "
- ✓Consulta el dato, escribe, envía y te devuelve el resultado.
- ✓La IA es un asistente; tú supervisas, no ejecutas.
📊 Expectativa honesta (igual que en el módulo 1.1)
Delegar es poderoso, pero no es magia. Un agente aún puede equivocarse (recuerda la alucinación, del módulo 1.2) y tropezar con tareas largas sin supervisión. Por eso un buen Jarvis tiene frenos: confirmación para acciones importantes (enviar dinero, borrar un archivo), un límite de iteraciones y un registro de lo que hizo. La idea no es confiar a ciegas, sino delegar con redes de seguridad.
Estos frenos son tema de la Trilha 4 ("Construir"); aquí basta con saber que existen y que forman parte de un agente bien hecho.
🌉 El puente hacia Anatomia (Trilha 3)
Ya tienes las tres piezas fundamentales: cerebro (el LLM, módulo 1.2), manos (las herramientas) y movimiento (el loop). Con esto, la Trilha 1 está completa. A partir de aquí, el curso abrirá ese agente en seis capas — canales, identidad, herramientas, skills, agentes y cerebros, uno a la vez. Es como pasar de la idea «un Jarvis actúa» al detalle de como cada parte funciona y se ensambla.
Autoevaluación (opcional): ¿qué frase resume mejor qué hace que una IA se convierta en un «agente»?
Conceptos clave
Entregar toda la tarea, no solo pedir una respuesta.
Tú revisas el resultado; el agente hace los pasos.
Confirmación, límite de iteraciones y registro de lo que se hizo.
Cerebro + manos + loop, abiertos en 6 capas en la Trilha 3.
🎯 Resumen del módulo
Siguiente:
Volver a la Trilha 1 — concluiste los Fundamentos. A continuación vienen la Trilha 2 (El Panorama) y la Trilha 3 (Anatomía), donde el agente se abre capa por capa.