PTENES
MÓDULO 1.3

📦 Qué es Ollama y los modelos abiertos

Para ejecutar un LLM en tu máquina, necesitas dos cosas: un programa que sabe cargar y servir el modelo, y el modelo en sí. El programa es el Ollama; los modelos son los «abiertos» (Qwen, Gemma, Mistral...). Este módulo explica qué es cada uno y cómo se comunican.

6
Temas
~30
Minutos
Básico
Nivel
Teoría
Tipo
1

📦 Qué es Ollama

En el módulo 1.2 separamos el LLM (el cerebro) de la interfaz de chat. Pero el cerebro no funciona por sí solo: alguien tiene que descargar el archivo del modelo, cargarlo en la memoria y estar listo para responder. Ese «alguien» es Ollama — el programa que administra y ejecuta modelos abiertos en tu máquina.

¿Nuevo por aquí? Ollama es un software gratuito que instalas (Mac, Windows o Linux). Piensa en él como una «central de modelos»: con él descargas un LLM, conversas con el modelo y cambias de modelo cuando quieras, todo localmente. El término técnico para este papel es runtime, es decir, el programa que hace que el modelo realmente EJECUTE.

Ollama ofrece dos formas de empezar, y tú eliges la que prefieras: una app con ventana (haces clic y conversas, como en un chat común) y el terminal (escribe comandos cortos). Ambas se comunican con el mismo motor por debajo: son solo dos formas de pedir lo mismo.

App de Ollama con el selector de modelos abierto: el campo «Find model...» muestra modelos como qwen3, gemma y otros para descargar y usar
Fotograma del video: la aplicación de Ollama con el menú desplegable "Find model..." abierto. Fíjate en la lista (qwen3, gemma...): son los «modelos abiertos» del próximo tema, listos para descargar con un clic. Es la opción más amigable para quien no quiere usar la terminal.

Conceptos clave

Ollama

Programa que descarga, administra y ejecuta modelos localmente.

Runtime

El motor que hace que el modelo se ejecute realmente en la máquina.

App + terminal

Dos puertas para el mismo motor; usa la que prefieras.

Gratis

Instalación libre en Mac, Windows y Linux.

2

🔓 Modelos abiertos

Ollama es el programa; los modelos abiertos son lo que ejecuta. «Abierto» aquí significa pesos abiertos (open weights): cualquier persona puede descargar el archivo del modelo y usarlo gratis en su propia máquina. Esto es lo que hace posible el uso local; sin eso, siempre dependerías del servidor de una empresa.

¿Nuevo por aquí? Los pesos ("weights") son los números que el modelo aprendió durante el entrenamiento: su "conocimiento", en un archivo. Un modelo cerrado (como los de OpenAI) guarda esos pesos en el servidor y tú solo accedes mediante API. Un modelo de pesos abiertos publica el archivo: lo descargas y lo ejecutas donde quieras. Por eso, «abierto» es la clave del curso.

Qwen

Familia de Alibaba; el curso usa Qwen3 (versiones 30B-A3B y 32B).

Gemma

Familia abierta de Google; se menciona Gemma 3 27B.

Mistral

Modelos franceses; se menciona Mistral Small 3.2 24B.

DeepSeek

También se menciona una familia abierta sólida en razonamiento.

🌱 Por qué es bueno tener varios modelos

Cada familia tiene fortalezas diferentes (una es mejor para código, otra para texto y otra es más ligera). Como son abiertas y gratuitas, puedes descargar varias, probarlas y quedarte con la que te sirva. Esa libertad para cambiar es algo que los modelos cerrados no ofrecen.

Conceptos clave

Modelo abierto

De pesos abiertos: cualquiera puede descargarlo y ejecutarlo.

Pesos (weights)

Los números aprendidos durante el entrenamiento: el «conocimiento» del modelo.

Cerrado vs. abierto

Lo cerrado permanece en el servidor; lo abierto lo descargas.

Familias

Qwen, Gemma, Mistral, DeepSeek: cada uno con sus fortalezas.

3

⬇️ Descárgalo una vez, ejecútalo localmente

Aquí está el detalle que cambia todo en el costo: tú descarga el modelo UNA vez. Después de eso, el archivo queda en tu disco y funciona localmente: sin una nueva conexión ni un nuevo cobro. Es la diferencia entre comprar un libro (pagas una vez y lo lees siempre) y alquilarlo por página leída.

1

Descarga (una vez)

Ollama descarga el archivo del modelo de Internet. Es el único paso que necesita conexión de red — y puede ser pesado (algunos modelos superan los 15 GB).

2

Permanece en el disco

El modelo pasa a ser tu archivo local. Puedes listar lo que ya descargaste con ollama list y borra lo que no uses.

3

Se ejecuta sin conexión, gratis

A partir de aquí, cada conversación ocurre en tu máquina — sin internet y sin costo por uso, para siempre.

Objetivo: ver los modelos que ya descargaste terminal
ollama list
Cómo verificar: aparece una tabla con NAME, SIZE y MODIFIED. Una lista vacía significa que todavía no descargaste ningún modelo (lo haremos en la Trilha 2). Comando real, ejecútalo tal como está, sin cambiar nada.

¿Nuevo por aquí? O terminal y es esa pantalla de texto donde escribes comandos. Cada comando de Ollama empieza con la palabra ollama seguida de lo que quieres (list, run, pull...). Solo lo usarás de verdad en la Trilha 2; por ahora, basta con reconocer el patrón.

Conceptos clave

Descarga única

Solo el primer paso necesita internet.

Archivo en el disco

El modelo pasa a ser tuyo; ocupa espacio (pueden ser GB).

ollama list

Muestra los modelos que ya se descargaron.

Uso $0

Después de descargarlo, cada conversación es gratuita.

4

🗂️ Cómo Ollama sirve el modelo

Aquí está la pieza que lo conecta todo. Cuando Ollama está en ejecución, no se queda esperando a que abras la app: mantiene un servicio local conectado en segundo plano, con un dirección en tu propia máquina. Cualquier programa en esta computadora puede enviar una solicitud a esa dirección y recibir la respuesta del modelo.

¿Nuevo por aquí? Un endpoint (o «dirección del servicio») es como un timbre local: un lugar fijo donde otro programa «toca» para pedir algo. El de Ollama está en tu propia máquina (en localhost — "esta máquina de aquí"), entonces la solicitud nunca sale de la computadora. EXACTAMENTE así es como Hermes se comunicará con tu modelo en la Ruta 2.

tu máquina (localhost) — nada sale de aquí Hermes(el agente) solicitud → servicio Ollamaendpoint local carga → modelo (LLM)en la memoria ← respuesta

Sigue las flechas: el Hermes hace la solicitud al servicio de Ollama, que carga el modelo y devuelve la respuesta, todo dentro del recuadro punteado (tu máquina). Ese es el conducto que vas a conectar en el módulo 2.5.

Conceptos clave

Servicio local

Ollama queda activo en segundo plano, listo.

Endpoint

La dirección donde otros programas solicitan respuestas.

localhost

"Esta máquina": la solicitud nunca sale de la computadora.

Puente para Hermes

Y es a través de este endpoint que el agente se comunica con el modelo.

5

🔢 Parámetros: qué significa la "B"

Verás nombres como Qwen3 32B o Gemma 3 27B. Esa «B» es lo primero que debes entender al elegir un modelo: indica los parámetros, en miles de millones. En términos generales, más parámetros = modelo más capaz, pero también más pesado.

¿Nuevo por aquí? Parámetros son los «ajustes internos» que aprendió el modelo: esos son los pesos del tema 2, ahora cuantificados. «32B» quiere decir 32 mil millones de ellos. Como cada parámetro ocupa espacio en la memoria, la «B» también da una pista de cuánta RAM lo que pida el modelo. (RAM = la memoria de trabajo de la computadora; lo explicamos en detalle en el módulo 1.4.)

más «B» → más capaz, más pesado ~8Bligero / rápido ~27-32Bequilibrio (del video) 70B+muy capaz, exige bastante RAM

La barra crece con la «B»: el de ~8B y ligero y rápido, los de 27-32B (los del video) son el equilibrio, y los 70B+ son más capaces, pero requieren mucha más memoria. «Más grande» no siempre es lo adecuado para TU equipo.

📊 Cuidado con la lectura

Más «B» no es automáticamente mejor para ti: un modelo demasiado grande no cabe en tu memoria y puede que ni siquiera se ejecute. El número correcto es el que ofrece buena calidad DENTRO de lo que tu hardware soporta: tema del módulo 1.4 y de la elección práctica en la Trilha 2.

Conceptos clave

Parámetros

Los ajustes internos aprendidos; la «B» los cuenta en miles de millones.

32B

32 mil millones de parámetros, por ejemplo.

Más grande = más pesado

Más parámetros requieren más RAM y son más lentos.

Adecuado para ti

El mejor "B" depende de tu hardware, no del número más grande.

6

🆚 Ollama (local) vs. nube

Para completar el vocabulario, conviene compararlos directamente. Usar un modelo por Ollama es usar un modelo mediante la nube resuelven el mismo problema (generar texto), pero en lugares y condiciones muy diferentes.

✓ Ollama (local)

  • ✓El modelo está en tu disco; los datos no salen.
  • ✓Gratis después de descargar; funciona sin conexión.
  • ✓Eliges y cambias de modelo libremente.
  • ✓Limitado por la RAM y el chip de tu computadora.

✗ Nube (modelo de API)

  • ✗Los datos se transfieren al servidor de la empresa.
  • ✗Cobra según el uso y requiere internet.
  • ✗No controlas el modelo ni los cambios de reglas.
  • ✓A cambio, suele ser más potente en las tareas difíciles.

Sin ideología: como vimos en el 1.1, no es «Ollama siempre». La nube es mejor para tareas pesadas; el modelo local, para la privacidad, el costo y trabajar sin conexión. Hermes te permite usar ambos, y los tres modos del 1.6 sirven precisamente para alternar entre ellos.

Conceptos clave

Local (Ollama)

Privado, gratis, sin conexión; limitado a tu hardware.

Nube (API)

Potente, pero de pago, en línea y con los datos saliendo.

Mismo objetivo

Los dos generan texto; cambian el lugar y las condiciones.

Coexistencia

Hermes alterna entre local y nube (módulo 1.6).

Autocomprobación (opcional): ¿qué relación hay entre Ollama y un modelo como Qwen3?

🎯 Resumen del módulo

✓
Ollama — el programa (runtime) que descarga, administra y ejecuta modelos locales; aplicación + terminal.
✓
Modelos abiertos — de pesos abiertos (Qwen, Gemma, Mistral, DeepSeek): los descargas y ejecutas.
✓
Descarga una vez + sirve localmente — después funciona sin conexión y gratis; el endpoint local es la forma en que Hermes se comunica con el modelo.
✓
La «B» = miles de millones de parámetros — más capaz y más pesado; el adecuado es el que cabe en tu máquina.

Siguiente módulo:

1.4 — Ventana de contexto y parámetros