🌱 Fundamentos
Empieza desde cero, sin nada de jerga: qué es, después de todo, un «Jarvis», qué es el LLM que piensa detrás de él y el momento exacto en que la IA deja de solo responder y empieza a ACTUAR por ti. Tres módulos que desbloquean todo lo demás del curso.
Lee de izquierda a derecha: es el mapa de la ruta. Empiezas por chatbot que solo responde (1.1), entiende el LLM como el cerebro y el contexto como tu memoria de trabajo (1.2), y llega al agente que piensa y ACTÚA usando herramientas reales (1.3).
Mapa de la ruta
Contenido detallado
🤖 Qué es un «Jarvis»: de la ficción a tu casa
La fantasía del asistente de Iron Man se convirtió en algo que se puede construir. Aquí entiendes el concepto sin jerga: por qué un chatbot no es Jarvis, qué es un «sistema operativo de IA» y qué se puede hacer hoy (y qué todavía no).
Jarvis, de Iron Man, es la fantasía de un asistente que conversa, lo recuerda todo y HACE tareas. En este curso, “Jarvis” = un asistente personal de IA que tú mismo construyes, y hoy esto es real, no ficción.
Tener la imagen correcta en mente evita decepciones y exageraciones: apuntarás a lo que se puede construir ahora.
Asistente personal de IA: conversar + recordar + actuar, de la fantasía a algo construible.
Un chatbot como ChatGPT responde. Un Jarvis actúa en el mundo: envía un correo electrónico, lee tu agenda, ejecuta una tarea por su cuenta. La diferencia no está en cuán inteligente es el texto, sino en si hace que algo suceda.
Es la distinción que organiza todo el curso; sin ella, todo lo demás se convierte en "un chat mejor".
Responder frente a actuar, acción en el mundo, «el salto» que define a un Jarvis.
Así como Windows organiza programas, memoria y periféricos, un sistema operativo de IA organiza el modelo, la memoria, las herramientas y los canales para que el asistente «viva». Es el hogar que reúne las piezas.
Es exactamente lo que vas a montar en las siguientes rutas; tener la metáfora lista lo facilita todo.
SOLO de IA, modelo + memoria + herramientas + canales, orquestación.
Se encontraron tres cosas: modelos suficientemente buenos, hardware personal capaz y estándares abiertos (como el MCP, que permite conectar herramientas con cualquier agente). Por eso hoy se puede construir lo que ayer era ficción.
Entrar temprano en una ola en formación es donde está la ventaja: aprendes antes de que se vuelva obvio.
Modelos capaces, hardware personal, estándares abiertos (MCP), timing.
SÍ se puede hacer: texto, búsquedas, agenda, borradores, automatizaciones. TODAVÍA NO se puede: tareas largas sin supervisión, y él alucina (inventa cosas con confianza). Calibrar esto es la mitad del camino.
Saber cuáles son los límites evita los dos errores clásicos: confiar demasiado o rendirse demasiado pronto.
Casos graves, alucinación, supervisión humana, expectativas realistas.
Fundamentos (aquí) → Panorama (lo que ya existe) → Anatomía (las 6 capas) → Construir → Celular → Niños. Cada ruta se apoya en la anterior; el orden fue pensado.
Ver todo el recorrido te da contexto para que cada parte tenga sentido en el momento adecuado.
6 recorridos, progresión T1→T6, del concepto a la construcción.
🧠 El cerebro de todo esto: qué es un LLM (sin jerga)
El motor que piensa detrás de todo Jarvis, explicado sin misterios: qué es un LLM, cómo «piensa» al predecir la siguiente palabra, qué son el contexto y los tokens, y la elección entre ejecutarlo en la nube o en tu computadora.
Uno LLM ("Modelo de Lenguaje Grande") es un programa entrenado con MUCHÍSIMO texto que aprendió a predecir la siguiente palabra. Es lo que funciona detrás de ChatGPT y Claude: el cerebro que "piensa en texto".
Es la pieza central de cualquier Jarvis; entender qué es desmitifica todo lo demás.
LLM, predicción de la siguiente palabra, entrenamiento con texto, «cerebro».
No consulta una base de datos ni «investiga»: es predicción estadística aprendida durante el entrenamiento. Por eso es creativo Y a veces se equivoca con toda confianza — lo que llamamos alucinación.
Saber que es una predicción explica tanto la magia como los errores y te enseña a verificar las respuestas.
Predicción estadística, no es una base de datos; alucinación.
A ventana de contexto y es todo lo que el modelo «está viendo ahora»: tu conversación + instrucciones + archivos. Es como la RAM de la computadora — limitada, y se vacía cuando cierras la conversación.
Explica por qué "olvida" — y prepara el terreno para la memoria persistente de la Trilha 3.
Ventana de contexto, memoria de trabajo, analogía con la RAM, se olvida al cerrar.
El modelo lee y escribe en tokens — fragmentos de palabras (una palabra común suele equivaler más o menos a un token; las palabras largas se convierten en varios). La nube cobra por token, y la ventana de contexto se mide en tokens.
Es la unidad de medida del costo y del contexto; aparece en toda decisión práctica.
Tokens, tokenización, token ≠ palabra, costo por token.
Nube (Claude, GPT): potentes, pagas por uso. Local (mediante Ollama): gratis después de descargarlo, privado, pero requiere hardware. Ambos cumplen el mismo papel: ser el cerebro.
Es la disyuntiva que volverá en todo el curso: privacidad/costo de un lado, potencia/conveniencia del otro.
Nube frente a local, Ollama, pago por uso frente a hardware, privacidad.
El LLM por sí solo alucina, no sabe cosas posteriores a su entrenamiento y olvida lo que queda fuera del contexto. La solución: darle herramientas (buscar, leer) y memoria — exactamente lo que enseña la Trilha 3.
Cada límite tiene una solución concreta; saber cuál es te ayuda a salir de la frustración.
Límites del LLM, corte del entrenamiento, herramientas + memoria como solución.
⚙️ De chatbot a agente: cuando la IA empieza a actuar
El momento decisivo del curso: cuando el LLM deja de solo responder y pasa a ACTUAR. Aquí entenderás el bucle agéntico, qué son las herramientas y la metáfora del «LLM como sistema operativo» que impulsa a toda la industria.
Cuando le das herramientas a un LLM y dejas que las use en un ciclo, se convierte en un agente: un LLM que puede ACTUAR, no solo responder. Ese es el salto que transforma el chat en un asistente.
Está en el centro de todo: es la definición de "agente" que acompaña el curso hasta el final.
Agente, LLM + herramientas en ciclo, responder vs. hacer.
O bucle agéntico y el ciclo: recibe la solicitud → piensa → llama a una herramienta → lee el resultado → llama a más, si hace falta → responde. Hay un límite de iteraciones por seguridad, para que no se ejecute para siempre.
Es el mecanismo que hace que un agente «trabaje solo»; entenderlo desmitifica la autonomía.
Bucle agéntico, piensa-actúa-lee-repite, límite de iteraciones.
Herramientas (o «tools») son las manos y los ojos del agente: buscar en la web, ejecutar código, leer un archivo, enviar un mensaje. Sin herramientas, el modelo «responde como un desconocido» —solo con lo que sabe de memoria.
Son lo que conecta el cerebro con el mundo real; toda la Ruta 3 gira en torno a eso.
Herramienta/tool, manos y ojos, acción en el mundo, «responder como un desconocido».
Andrej Karpathy (2023) propuso: el LLM es el kernel (el núcleo) de un sistema operativo nuevo. Contexto = RAM, herramientas = periféricos, agentes = procesos. La industria adoptó este modelo mental.
Es la metáfora que conecta el "SO de IA" con lo que ya sabes sobre computadoras y que sustenta el curso.
LLM-OS, kernel, contexto=RAM, herramientas=periféricos, agentes=procesos.
La idea se hizo realidad: AIOS (un «kernel» real para agentes), OpenAI Operator (un agente que navega por pantallas) y el Google Project Jarvis (agente que opera Chrome por ti). Pruebas de que el modelo mental funciona.
Muestra que esto no es hype aislado — grandes laboratorios construyen en la misma dirección que tú.
AIOS, Operator, Project Jarvis, de la metáfora al producto.
En la práctica, dejas de "preguntar" y empiezas a "delegar": en vez de pedir un texto, asignas una tarea. Es el puente directo a la Anatomía (Trilha 3), donde montas las 6 capas que lo hacen posible.
Cierra los Fundamentos con el cambio de actitud que desbloquea el resto del curso.
Preguntar vs. delegar, cambio de postura, puente hacia la Anatomía.