🧠 Fundamentos
Antes de instalar nada: por qué ejecutar IA localmente, el vocabulario que usarás durante todo el curso (LLM, agente, «SO de IA»), qué es Ollama, qué es la ventana de contexto y los tres modos de operar entre lo privado y la nube.
Lee de izquierda a derecha: lo que iba a nube pasa a estar en la tu máquina, que alimenta la memoria, el agente y el modelo, con un resultado de costo cero, sin conexión y privado.
Mapa de la ruta
🌍 Por qué lo local es el futuro
La nube fue el pasado
🗣️ El vocabulario
LLM, agente, SO de IA
📦 Qué es Ollama
La clave de los modelos abiertos
🪟 Contexto y parámetros
Por qué 64k importa
⚖️ La compensación
Privacidad, rendimiento, precio
🗄️ Los tres modos
Vault, Connected, Cloud
Contenido detallado
🌍 Por qué la IA local es el futuro
La dirección de la industria: de la nube al entorno local. Ownership, costo cero, uso sin conexión y los casos en los que esto cambia las reglas del juego.
La industria trasladó todo a la nube; ahora el movimiento es de vuelta a la máquina del usuario: el entorno local.
Entender la «dirección del viaje» te pone a la vanguardia: la capacidad de ejecutar modelos localmente será tan básica como usar una computadora.
De la nube a lo local, ownership, supercomputadora personal (la analogía de Jensen Huang).
Tienes físicamente el modelo y los datos; nada va a OpenAI o Anthropic.
Dejar de «alquilar inteligencia» cambia el juego en cuanto a costo, privacidad y control.
Propiedad, datos en casa, sin vigilancia, sin dependencia de un proveedor.
Después de descargar el modelo, cada uso es gratuito: no hay cobro por token ni mensualidad.
Los agentes en segundo plano pueden ejecutarse 24/7 sin darte un susto en la factura.
CAPEX vs OPEX, $0/token, sin límite de solicitudes.
Como el modelo se ejecuta en tu máquina, funciona sin conexión: en el avión, sin conexión a la red, donde sea.
Tu productividad ya no depende de la conexión ni de que un servicio esté en línea.
Disponibilidad, resiliencia e independencia de la red.
Datos de clientes, salud, IP propietario y entornos regulados (SOC 2, GDPR, ISO 27001).
Para muchas empresas, lo local no es un lujo: es la única forma legal de usar IA con ciertos datos.
Compliance, soberanía de datos, "cerebro privado" del equipo.
Local no es una religión: usas lo mejor para el trabajo y cambias cuando deja de serlo.
Evita el error de forzar el uso local cuando la nube ofrece mucho más, y viceversa.
Pragmatismo, «sigue lo que funciona», división por % de trabajo.
🗣️ El vocabulario: LLM, agente y SO de IA
Las palabras que aparecen a lo largo del curso, definidas desde cero: LLM, agente, herramientas, memoria, persona, skill y qué es un «sistema operativo de IA».
Un LLM es el modelo de IA que funciona detrás de ChatGPT: predice la siguiente palabra a partir del texto.
Es la pieza que vas a descargar y ejecutar; saber qué es despeja el misterio del resto.
Modelo, predicción de tokens, pesos.
Un agente es un LLM que usa «herramientas»: buscar en la web, ejecutar código, editar archivos, por sí solo.
Hermes es un agente; entender las herramientas explica por qué hace cosas, no solo responde.
Herramientas (tools), acción, loop de razonamiento.
Un lugar único que reúne la memoria, las skills, las conexiones y los agentes de tu mundo de IA.
Y es lo que vas a montar en la Ruta 3: el «SO Hermes» funcionando localmente.
Orquestación, un lugar para todo, configurable.
Memoria = lo que recuerda; persona = cómo actúa; skill = una capacidad que conectas.
Son los bloques que configuras para que el agente se convierta en TU agente.
Memoria persistente, comportamiento y capacidades conectables.
Integraciones que le dan al agente acceso a fuentes: repositorios, archivos, herramientas.
Las conexiones transforman al agente de "conversador" en "operador" de tu trabajo.
Integraciones, contexto externo, acciones en el mundo real.
Local = se ejecuta en tu computadora; nube = se ejecuta en la infraestructura de una empresa.
Es la distinción que organiza todo el curso y los tres modos del módulo 1.6.
Infraestructura propia frente a alquilada, dónde quedan los datos.
📦 Qué es Ollama y los modelos abiertos
El programa que habilita los modelos abiertos (Qwen, DeepSeek, Gemma, Mistral) en tu máquina: los descargas una vez y los ejecutas gratis para siempre.
Un programa que descarga, administra y ejecuta modelos de IA en tu máquina, con app y terminal.
Es la base de todo: sin él, no hay un modelo local que el agente pueda usar.
Runtime local, gestor de modelos, fácil de usar.
Modelos publicados abiertamente que puedes descargar y ejecutar sin pedirle permiso a nadie.
La competencia del open-source es lo que hace viable el uso local y lo mejora cada vez más.
Open weights, familias de modelos, elección según la tarea.
El modelo queda en tu disco; después de descargarlo, solo necesitas internet para descargar otros.
Explica el "offline" y los "$0/token" en la práctica.
Descarga única, ejecución local, caché en disco.
Inicia un servicio local que recibe tu texto y devuelve la respuesta del modelo.
Así es como el Agente Hermes se «comunicará» con el modelo en la Trilha 2.
Servidor local, endpoint, modelo cargado en memoria.
El «30B» en el nombre quiere decir 30 mil millones de parámetros — el tamaño del modelo.
Más parámetros = más capaz, pero más pesado para tu máquina.
Parámetros, tamaño vs. capacidad, costo del hardware.
Con la nube usas su infraestructura; con Ollama, todo se ejecuta y permanece en tu computadora.
Deja claro qué obtienes (privacidad/costo) y a qué renuncias (potencia bruta).
Medido frente a local, control y compensaciones.
🪟 Ventana de contexto y parámetros
Qué es la ventana de contexto, qué es un token, por qué el Agente Hermes exige 64k y cómo se relaciona el tamaño del modelo con tu RAM.
Cuánto texto puede "retener en la cabeza" el modelo a la vez al responder.
Es lo que limita (o permite) tareas largas, como un agente con memoria.
Contexto, límite de entrada+salida, memoria de trabajo.
La unidad que el modelo lee o genera — un token equivale a ~3/4 de una palabra en inglés.
La ventana de contexto se mide en tokens; 64k tokens ≈ 25-30 mil palabras.
Token, tokenización, tokens ≠ palabras.
El Agente Hermes requiere un modelo con al menos 64.000 tokens de contexto debido a la memoria y las herramientas.
Y por eso descargas Qwen 3 Coder 64k en la Ruta 2, y no cualquier modelo.
Requisito de contexto, memoria del agente, las herramientas ocupan contexto.
Parámetros = el tamaño del «cerebro»; contexto = cuánto lee de una vez. Son independientes.
Un modelo de 30B puede tener un contexto pequeño; necesitas revisar ambos números.
Tamaño ≠ contexto; consulta la ficha del modelo.
El modelo debe caber holgadamente en la memoria; si es demasiado grande, la máquina se vuelve lenta.
Evita el error de descargar un modelo que bloquea tu computadora.
RAM/VRAM, headroom, descargar→probar→borrar.
Para conversaciones cortas, basta con un modelo más pequeño y rápido; 64k es para el agente.
Puedes tener más de un modelo y usar el adecuado para cada cosa.
Modelo rápido vs. modelo del agente, múltiples modelos.
⚖️ La compensación: privacidad, rendimiento y precio
La verdad, sin rodeos: el mejor modelo local está ~1 año por detrás de la frontera. Qué sacrificas, qué dicen las pruebas de rendimiento y cómo dividir tu trabajo.
Con el entorno local, el dato nunca sale de tu computadora: ninguna empresa ve lo que escribes.
Es el punto fuerte de lo local y el motivo número 1 de muchos casos de uso.
Confidencialidad, soberanía de datos.
El mejor modelo local de hoy equivale al mejor de frontera de hace ~12 meses.
Ajusta tus expectativas: es muy bueno, pero no es lo mejor de todo.
Un desfase de ~1 año, al ritmo del código abierto.
Después del hardware que ya tienes, el uso es gratuito, sin suscripción.
Cambia la economía de ejecutar agentes todo el día.
$0/token, sin mensualidad; solo pagas energía/hardware.
Números que comparan modelos (p. ej., ~88,6 de Opus 4.8 frente a ~74 del Qwen que ejecutas).
Te ayuda a leer comparaciones con ojo crítico, sin volverte rehén de los benchmarks.
Benchmark, lectura crítica, "optimizar benchmark".
La velocidad de respuesta depende de tu computadora; los modelos grandes son lentos.
Eliges entre rapidez y calidad según lo que necesites en cada momento.
Latencia, hardware, tamaño del modelo.
Imagina el 100% de tu trabajo: una parte requiere privacidad total, otra requiere la máxima calidad.
Y es el razonamiento que lleva directamente a los tres modos del módulo 1.6.
Dividir las tareas y usar la mejor herramienta para cada parte.
🗄️ Los tres modos: Vault, Connected y Cloud
Cómo operar entre la privacidad total y la mejor calidad: Vault (privado), Connected (rendimiento) y Cloud (calidad), y cuándo usar cada uno.
Modo bóveda: el agente solo usa el modelo local, nada sale de la máquina.
Es el modo para datos sensibles y para cuando estás sin conexión.
Modo Vault, aislamiento, privacidad total.
Modo conectado, que ofrece más potencia cuando necesitas un empujón.
Es el punto medio entre privacidad total y calidad máxima.
Modo Performance, equilibrio.
Modo nube, para cuando la calidad bruta importa más que la privacidad.
Saber cuándo activar la nube evita perder tiempo usando un modelo local en tareas difíciles.
Modo Cloud, calidad > privacidad, web actualizada.
Datos de clientes, finanzas, notas de salud, código propietario o simplemente cuando no hay internet.
Es la regla práctica que te indica en qué modo quedarte.
Criterio de sensibilidad, regla de decisión.
Puedes pedirle a Hermes que envíe una tarea al modelo privado y otra a la nube.
Es el corazón del Proyecto 6 de la Trilha 3.
Enrutamiento dinámico, "envíalo al privado".
Como el entorno local es gratis, puedes dejar agentes trabajando todo el día sin costo por uso.
Es una de las mayores ventajas prácticas del Vault mode.
Agentes en segundo plano, costo cero, automatización.