🧬 Anatomía
Las 6 capas que transforman un chat común en un asistente que ve, recuerda y actúa. Cada módulo abre una "parte del cuerpo" de tu Jarvis — Canales, Identidad, Herramientas, Skills, Agentes y Cerebros — para que entiendas el conjunto pieza por pieza.
Lee de izquierda a derecha: tú habla con el Jarvis, que activa las 6 capas en orden — y el resultado es una acción en el mundo. Cada módulo de esta ruta abre una capa.
Mapa de la ruta
Contenido detallado
📡 Canales: por dónde hablas con él
Las puertas de entrada y salida de tu Jarvis. Por qué Telegram se convirtió en el favorito, cómo entran WhatsApp y la voz, y por qué la whitelist es la primera barrera de seguridad.
Uno canal es la "puerta" por donde conversas con Jarvis: puede ser Telegram, WhatsApp, la voz, una página web o la propia terminal. El cerebro es el mismo; solo cambia la puerta.
Elegir el canal correcto determina si vas a hablar con él desde el celular, la PC o desde cualquier lugar, y también cuánto expones el sistema.
Canal, entrada/salida, multicanal, el cerebro único detrás de las puertas.
Telegram solo pide un token (una contraseña generada por @BotFather). Usa long-polling: es tu Jarvis que va a buscar mensajes en Telegram, en vez de abrir un servidor web a la espera de una conexión.
Long-polling = ningún puerto abierto a internet = un puerto menos para los atacantes. Por eso es el canal más seguro para empezar, además de ser gratis y ya estar disponible en el móvil.
@BotFather, token, long-polling, cero servidores expuestos.
Además de Telegram, puedes conectar WhatsApp (texto, imagen y voz, mediante Evolution API), correo electrónico y web. Multicanal significa tener el mismo cerebro respondiendo en varios lugares.
Cada persona vive en una app diferente; saber que el cerebro es independiente del canal te permite elegir dónde aparece tu Jarvis.
WhatsApp, Evolution API, correo electrónico, web, un cerebro / muchas bocas.
A lista de permitidos y una lista de quién puede hablar con el bot. Solo se atiende TU ID de usuario; cualquier otro se ignora en silencio, sin recibir siquiera una respuesta de error.
Un bot público que responde a todo el mundo gasta tu dinero y puede ser manipulado. La lista blanca es la defensa más sencilla y la primera que activas.
Lista de permitidos, ID de usuario, propietario único, ignorar en silencio.
El mismo canal transporta texto y audio (Telegram envía la voz en un archivo .ogg) e imagen. La voz es una entrada/salida opcional, decidida en el momento.
Entender que la voz es solo otro tipo de medio en el canal te prepara para la Trilha 5, donde se construye de verdad el pipeline de voz.
Texto, audio .ogg, imagen, voz opcional decidida en runtime.
Como el canal es una app de mensajería, puedes acceder a tu Jarvis desde cualquier dispositivo donde tengas esa app —celular, tableta, PC— sin necesitar una app propia en la tienda.
Es el atajo que evita construir y publicar una aplicación: «Telegram ya es móvil». Esto vuelve con fuerza en la Ruta 5.
Sin app nativa, multidispositivo, sincronizado por la propia app.
🪪 Identidad — memoria, personaje y quién es
Lo que le da carácter y memoria a Jarvis: el alma (SOUL.md), el contrato (AGENTS.md), tu perfil, la memoria que persiste cuando cierras la conversación y por qué «a quién atiende» también forma parte de su identidad.
O SOUL.md y un archivo de texto con la personalidad, los valores, el tono y las prioridades de su dueño. Se inyecta SIEMPRE en el system prompt (las instrucciones invisibles que el modelo lee antes que nada).
«Sin reconectar el cerebro, la arquitectura es solo una carpeta»: SOUL.md hace que el asistente suene como TUYO, y no como un chatbot genérico.
SOUL.md, system prompt, ficha de personaje, tono y valores.
O AGENTS.md dice lo que SÍ hace y lo que NUNCA hace, en listas explícitas de "SIEMPRE" y "NUNCA". Es el contrato de comportamiento.
Una regla escrita vale más que esperar que el modelo la adivine. Aquí defines los límites — algo que cobra mucha importancia en la ruta para niños.
AGENTS.md, listas SIEMPRE/NUNCA, reglas explícitas, guardrails.
El archivo USUARIO guarda quién eres: nombre, contexto, preferencias, personas y proyectos importantes para ti. Es la ficha del dueño.
Sin esto, Jarvis te trata como a un desconocido en cada conversación. Con el perfil, ya sabe tu nombre, tu zona horaria y lo que sueles pedir.
USUARIO, perfil del dueño, contexto personal, preferencias.
La conversación lo olvida todo al cerrarla. La memoria persistente son archivos .md + un índice SQLite FTS5/BM25 (la búsqueda por palabras) y/o una base de datos vectorial (búsqueda por significado).
Es la diferencia entre un chat que empieza de cero cada vez y un asistente que recuerda lo que acordaron la semana pasada.
Memoria persistente, .md, SQLite FTS5/BM25, base de datos vectorial.
A quién atiende Jarvis también forma parte de quién es: la whitelist de ID (del módulo 3.1) más los secrets (claves de API) guardadas solo en el archivo .env.
La identidad no es solo personalidad: también es una frontera. Mezclar persona y autenticación deja claro que la seguridad es parte del carácter del agente.
Lista de permitidos, secretos, archivo .env, límite de identidad.
El mismo Jarvis puede cambiar de modo (trabajo, estudio, «modo cuentito») con solo cambiar qué SOUL/perfil está activo. Una persona y un conjunto de comportamientos intercambiables.
En lugar de mantener varios bots, mantienes uno y le cambias la «ropa». Esta es la base del tutor infantil de la Trilha 6.
Persona, modos, SOUL activo, un agente / varios atuendos.
🔧 Herramientas — las manos de Jarvis (tools + MCP)
Cómo Jarvis pasa de «solo hablar» a actuar: qué son las herramientas, cómo las llama el modelo y por qué MCP se convirtió en el «USB» que conecta de forma segura cualquier herramienta con cualquier agente.
Por sí solo, el LLM solo produce texto. Las herramientas (tools) le dan manos y ojos: buscar en la web, leer y escribir archivos, enviar correos electrónicos, ver la agenda, ejecutar un comando.
Es lo que separa «conversar» de «hacer». Sin herramientas, «responde como un desconocido»; con ellas, se convierte en un asistente de verdad.
Herramienta/tool, acción en el mundo, datos reales, manos y ojos.
Function-calling y es el mecanismo por el que el modelo «pide» una función (p. ej.: enviar_email(...)); el sistema lo ejecuta de verdad y devuelve el resultado para que el ciclo continúe.
Es la tubería que hay debajo de todo. Entender que el modelo solo PIDE (no ejecuta) explica por qué se pueden tener confirmación y sandbox.
Function-calling: el modelo solicita / el sistema ejecuta, y vuelve al ciclo.
O MCP (Model Context Protocol, de Anthropic, nov/2024) es un estándar donde cada integración vive en un servidor MCP separada y auditable. Es el «USB» de las herramientas de IA.
Con MCP puedes conectar Gmail, Notion o GitHub sin reescribir el agente, y puedes leer exactamente lo que hace cada servidor.
MCP, servidor MCP, estándar universal, integraciones conectables.
Descargar «skill files» de terceros es arriesgado: en OpenClaw se encontraron 341 skills maliciosas. MCP aísla cada integración en un servidor auditable, con permisos claros.
La lección de seguridad del curso: prefiere el estándar auditable (MCP) al código de un desconocido que nunca has leído.
341 skills maliciosas, código de terceros, auditabilidad, solo MCP.
Las acciones peligrosas (ejecutar shell, borrar archivos) piden confirmación y se ejecutan en un sandbox (entorno aislado). Y toda entrada se trata como un posible prompt-injection (texto que intenta secuestrar al agente).
Darles manos a los agentes sin frenos es peligroso. La confirmación + el sandbox te permiten darles poder sin perder el control.
Confirmación, sandbox, prompt-injection, zero-trust.
Sin datos reales (tu agenda, tu correo electrónico), Jarvis solo responde de forma genérica. Conectar herramientas lo convierte de «conversador» en ASISTENTE que actúa en tu vida.
Es el «porqué» de toda la capa: la conexión con el mundo real es lo que le da valor práctico al agente.
Datos reales, genéricos vs. personales, Connections, valor práctico.
🧩 Skills: habilidades empaquetadas
Recetas reutilizables: qué es una skill, por qué empaquetar un paso a paso, cómo casi no consume contexto hasta que se usa y la verdad sincera sobre la portabilidad entre modelos.
Una skill y una receta: un archivo markdown (SKILL.md) que empaqueta un paso a paso repetido. Ej.: "escribe una publicación para LinkedIn" = investigar → gráfico → texto → revisar → publicar.
Es como enseñar un procedimiento una vez y reutilizarlo siempre: la base de la biblioteca de capacidades de tu Jarvis.
Skill, SKILL.md, receta, paso a paso empaquetado.
En vez de explicar los 5 pasos cada vez, dices una frase («haz mi publicación de la semana») y la skill ejecuta todo el procedimiento.
Empaquetar transforma instrucciones repetidas en un comando corto: menos esfuerzo para ti, más consistencia en el resultado.
Abstracción, comando corto, consistencia, reutilización.
O carga progresiva (progressive disclosure) hace que la skill ocupe solo el frontmatter (~100 tokens con nombre y descripción) hasta que se active. Solo entonces el paso a paso completo entra en el contexto.
Puedes tener decenas de skills sin saturar la ventana de contexto — el agente "sabe que existen" sin cargarlas todas.
Progressive disclosure, frontmatter, ~100 tokens, ahorro de contexto.
Una herramienta y una acción atómica («enviar correo electrónico»). Una skill y un procedimiento que ORQUESTA varias herramientas y aplica criterio entre ellas.
Confundir los dos lleva a diseñar mal. Herramienta = verbo único; skill = la receta que encadena los verbos.
Acción atómica frente a procedimiento, orquestación y criterio.
La spec de Agent Skills + o polyskill permiten que UNA fuente de skill funcione tanto en Claude Code como en Codex. «Múltiples modelos» aquí significa portabilidad, no un consejo de modelos que votan.
Evita el mito común: la ventaja real es no quedar atado a un runtime, no tener "varios cerebros decidiendo juntos".
Agent Skills, polyskill, compatibilidad entre entornos de ejecución, portabilidad honesta.
Cada ejecución puede mejorar la receta: el agente nota lo que falló y ajusta el SKILL.md. La biblioteca de skills se convierte en tu colección de capacidades que crece con el uso.
Las Skills no son estáticas: son activos vivos. Esto cambia cómo piensas en «enseñarle» a tu Jarvis con el tiempo.
Autocorrección, repositorio de capacidades, mejora continua.
🤝 Agentes: el loop que trabaja solo
La capa de autonomía: el loop agéntico como pieza, subagentes que ahorran contexto, multiagente, la cadencia (heartbeat/cron) que actúa sin ti — y los frenos que mantienen todo seguro.
Uno agente y un LLM que se ejecuta en bucle: recibe una solicitud → piensa → llama a una herramienta → lee el resultado → llama a más herramientas → responde. Aquí se convierte en una capa de la anatomía, con autonomía.
Es el motor que ya apareció en la Ruta 1; volver a verlo como capa conecta las piezas (herramientas, skills) en algo que actúa por sí solo.
Bucle agéntico, autonomía, solicitud→piensa→herramienta→respuesta.
El agente principal delega una tarea pesada a una subagente, que consume su PROPIO contexto y devuelve solo la respuesta final. La sesión principal queda ligera.
Es el truco para tareas grandes (leer 50 archivos, investigar mucho) sin saturar la ventana de contexto del agente principal.
Subagente, delegación, contexto aislado; solo vuelve la respuesta.
Multiagente y es tener varios especialistas (investigación, escritura, revisión) coordinados. Más poder, pero también más partes que coordinar y más cosas que pueden salir mal.
Saber cuándo vale la pena (y cuándo solo complica) evita el over-engineering, un error común de quien descubre el patrón.
Multiagente, especialistas, coordinación, costo de complejidad.
Cadencia son disparadores de tiempo: heartbeat, cron, rutinas que hacen que Jarvis actúe solo a la hora indicada: el resumen de las 7h, monitorear la bandeja de entrada, "con la laptop cerrada".
Es lo que transforma al asistente de «responde cuando lo llamo» en «trabaja mientras duermo». Vuelve como la 4.ª capa de CLAWS en la Ruta 4.
Heartbeat, cron, rutinas, acción programada.
Un loop autónomo necesita frenos: límite de iteraciones (para que no se ejecute para siempre), gates de aprobación para acciones serias y un registro de auditoría (registro forense de cada acción).
La autonomía sin límites es como dejar que el auto avance sin frenos. Estos controles son los que hacen confiable el «trabaja solo».
Tope de iteraciones, gates de aprobación, audit log forense.
Un agente reactivo responde cuando lo llamas. Un proactivo te avisa antes de que lo pidas ("tu vuelo se retrasó, ya reorganizé la agenda"). Es el salto de asistente a compañero.
Es el objetivo final de la capa de agentes, y solo tiene sentido con una cadencia, memoria y límites bien establecidos.
Reactivo vs. proactivo, anticipación, colaboración.
🧠 Cerebros: el motor que piensa y la memoria organizada
Honestamente: «cerebros» no es un consejo de modelos que votan. Es (a) el motor LLM intercambiable y (b) la memoria organizada en zonas. Aquí ves cómo cambiar de cerebro sin tocar el código y cómo el «segundo cerebro» se convierte en memoria.
El “cerebro” es el motor LLM — el modelo que piensa. Es conectable: se puede hacer hot-swap (cambio en caliente, sin reiniciarlo todo) mediante .env entre anthropic, openrouter u ollama. «Un cerebro, varias bocas.»
Tratar el modelo como una pieza reemplazable te libera de cualquier proveedor único —la tesis central del curso.
Motor LLM, hot-swap, .env, conectable, un cerebro/varias bocas.
La misma interfaz acepta distintos modelos: uno local y barato para tareas sencillas, uno potente en la nube para tareas difíciles. La elección se convierte en una decisión económica para cada respuesta.
Es cómo equilibras costo y calidad sin reescribir nada: solo apuntando al .env para otro modelo.
La misma interfaz, económica vs. potente, costo por respuesta.
En los proyectos no existe un juez o enrutador mágico con N modelos que votan juntos. "Varios modelos", dicho con honestidad, significa sustitución e portabilidad (cross-runtime), no votación simultánea.
Es una confusión común en el marketing de IA. Desmitificar esto te evita buscar una función que no existe.
Mito del consejo, sustitución, portabilidad, sin votación.
La otra acepción de «cerebros» es la memoria de Jarvis, organizada como un "segundo cerebro". Un montón de notas crece y se vuelve un desorden; separarlas en zonas pone orden.
Una memoria desorganizada es tan mala como no tener memoria. Estructurarla es lo que hace que el agente encuentre lo que importa.
Segundo cerebro, memoria organizada, zonas, evitar la acumulación.
La memoria se divide en 3: Proyecto (episódico: lo que pasó, decisiones), Self (identidad: valores, dudas — cambia lentamente) y Conocimiento (referencia: hechos que solo se acumulan). Una sola bandeja de entrada + una skill /triagem enruta, y [[wikilinks]] se cruzan los tres.
Es el esquema concreto que vas a aplicar para que la memoria de tu Jarvis no se convierta en un depósito.
Proyecto/Self/Conocimiento, inbox + /triagem, [[wikilinks]].
En el fondo, la memoria son archivos .md legibles (la verdad) + un índice SQLite FTS5/BM25 (la búsqueda rápida). El CLAUDE.md/AGENTS.md y es el ENRUTADOR que se lee al inicio de cada sesión.
«Sobrevive al hype porque es solo texto»: entender esto te evita depender de bases de datos exóticas y te permite ser dueño de tu memoria.
Filesystem .md, índice SQLite FTS5/BM25, CLAUDE.md/AGENTS.md como enrutador.