PTENES
MÓDULO 2.3

💬 Descargar y conversar con tu 1.er modelo

Llegó la hora del «¡guau!»: vamos a descargar un modelo de verdad, abrir un chat y ver cómo responde la IA en tu máquina. Dos comandos bastan: uno para descargar, otro para conversar — y al final desconectas Internet y el modelo sigue respondiendo.

6
Temas
~30
Minutos
Básico
Nivel
Práctico
Tipo
1

⬇️ Descargar el modelo

Con Ollama ya instalado (módulo 2.1) y el modelo elegido (módulo 2.2), el primer paso es descargar el modelo en tu disco. Vamos a usar qwen3:30b-a3b-q4_K_M — el modelo "rápido" recomendado, con cerca de 18 GB. La descarga es la única etapa que requiere internet; después de eso, el modelo funciona 100% sin conexión.

Terminal ejecutando ollama pull qwen3:30b-a3b-q4_K_M con una barra de progreso en 3%, que muestra 512MB de 18GB descargados
Fíjate en la barra de progreso y en el contador «512MB / 18GB»: Ollama muestra exactamente cuánto falta. Mientras se ejecuta, puedes ir a tomar un café: son gigabytes que llegan a tu máquina UNA sola vez.

🎯 Code-run: descargar el modelo

Objetivo: llevar el modelo rápido a tu disco. Pega en la terminal:

ollama pull qwen3:30b-a3b-q4_K_M

Cómo verificar: aparece una barra de progreso hasta success. Después, ollama list debe mostrar el modelo en la lista.

¿Nuevo por aquí? "Pull" (descargar) es el término de Ollama (tomado de Git/Docker) para descargar un modelo del repositorio oficial para tu computadora. El nombre qwen3:30b-a3b-q4_K_M y la «etiqueta»: qwen3 = familia, 30b = 30 mil millones de parámetros, a3b = arquitectura, q4_K_M = nivel de cuantización (compresión).

Conceptos clave

ollama pull

El comando que descarga un modelo en tu disco.

~18 GB

El tamaño de qwen3:30b-a3b-q4_K_M; necesita espacio en disco.

Descarga única

Solo usa internet una vez; después funciona sin conexión.

Etiqueta del modelo

familia:tamaño-arquitectura-cuantizacion.

2

💬 Conversar en la terminal

Modelo descargado, hora de conversar. El comando ollama run abre un chat dentro de la propia terminal: escribes, presionas Enter y el modelo responde ahí mismo. Para salir de la conversación, escribe /bye.

🎯 Code-run: conversar en la terminal

Objetivo: abrir un chat con el modelo y hacer la primera pregunta. Pega:

ollama run qwen3:30b-a3b-q4_K_M
>>> Explique em uma frase o que e uma janela de contexto.
... (a resposta aparece aqui) ...
>>> /bye

Cómo verificar: el prompt cambia a >>> y el modelo responde. /bye te devuelve a la terminal normal.

pulldescarga (1 vez) runabre el chat tú conversas>>> pregunta / respuesta /byetermina

De izquierda a derecha: pull descarga una vez, run abre el chat y conversas en el prompt >>> e /bye termina. Solo el «pull» necesita internet.

💡 Consejo práctico

Si ejecutas ollama run con un modelo que aún no descargaste, Ollama lo descarga automáticamente antes de abrir el chat. Pero separar el pull (descarga) del run (conversar) deja más claro lo que está pasando.

Conceptos clave

ollama run

Abre un chat con el modelo en la terminal.

Prompt >>>

Dónde escribes tus preguntas.

/bye

Sal de la conversación y vuelve a la terminal.

Auto-pull

run descarga el modelo si todavía no existe.

3

🖼️ Conversar en la app

¿No te gusta la terminal? No hay problema. La app de Ollama tiene una ventana de chat parecida a cualquier app de mensajería: eliges el modelo de una lista y conversas con el mouse y el teclado, sin escribir comandos. El motor de fondo es el mismo; solo cambia la interfaz.

App de Ollama con qwen3:30b-a3b-q4_K_M en la lista de modelos y el comando ollama run en pantalla
En la app, el el modelo descargado aparece en la lista listo para seleccionar. Ten en cuenta que es el mismo qwen3:30b-a3b-q4_K_M de la terminal; la app y la terminal comparten los modelos descargados, así que no tienes que descargarlos dos veces.

✓ Cuándo destaca la app

  • ✓Quien prefiere hacer clic en lugar de escribir comandos.
  • ✓Conversaciones largas, con historial desplazable.
  • ✓Cambiar de modelo desde un menú, sin memorizar etiquetas.
  • ✓Mostrarle a alguien sin asustarlo con la terminal.

✗ Cuándo gana la terminal

  • ✗Automatizar (scripts, pipelines).
  • ✗Ver mensajes de error detallados.
  • ✗Ejecutar comandos como pull/list/rm directamente.
  • ✗Conectar al agente (Hermes se comunica mediante un servicio/terminal).

Conceptos clave

App de chat

Interfaz gráfica de Ollama.

Lista de modelos

Los modelos descargados aparecen para seleccionarlos.

Mismo motor

La app y el terminal usan los mismos modelos.

Sin comandos

Conversación sin escribir nada en la terminal.

4

🧠 El «thinking»

Notarás que, antes de responder, el modelo a veces muestra algo como "Thought for 6.2 seconds". Eso es el thinking (razonamiento): los modelos modernos «piensan» en silencio antes de escribir la respuesta final. Este paso adicional suele hacer que la respuesta sea más correcta, a cambio de un poco más de tiempo.

Conversación con Qwen que muestra 'Thought for 6.2 seconds' y una respuesta sobre teoría del color
Mira el "Thought for 6.2 seconds" en la parte superior de la respuesta: el modelo razonó ~6s antes de escribir. Ese tiempo no es un "bloqueo": es el modelo pensando. La respuesta sobre teoría del color salió íntegramente de tu máquina, sin nube.

📊 Qué cambia el «thinking»

  • •Mejores respuestas: razonar antes reduce los errores en tareas difíciles.
  • •Un poco más lento: los segundos de "Thought for..." son el costo del razonamiento.
  • •Configurable: en Hermes, los interruptores Thinking/Fast te permiten priorizar la calidad o la velocidad.

¿Nuevo por aquí? "Thinking" (o "reasoning") es cuando el modelo genera un borrador de razonamiento interno antes de la respuesta final. Ves la etiqueta del tiempo, pero el borrador suele quedar oculto. Los modelos con thinking tienden a acertar más en lógica, matemáticas y código.

Conceptos clave

Thinking

Razonamiento interno antes de la respuesta.

"Thought for X s"

El tiempo que el modelo pasó pensando.

Calidad vs. velocidad

Pensar más permite acertar más, pero toma un poco más de tiempo.

Thinking/Fast

Opciones de Hermes para elegir el equilibrio.

5

⏱️ La velocidad y la primera carga

A primera una pregunta después de abrir el modelo suele tardar más. Eso es el 1er inicio (carga inicial): Ollama necesita cargar los 18 GB del modelo del disco a la memoria. A partir de la segunda pregunta, con el modelo ya "caliente" en la RAM, las respuestas salen mucho más rápido.

1

Cold start (1.ª vez)

El modelo se carga del disco a la RAM — la primera respuesta tarda más.

2

Modelo en caliente

Una vez en la memoria, las siguientes respuestas llegan rápido.

3

Se descarga solo

Después de un tiempo sin actividad, Ollama libera la RAM; entonces la siguiente vuelve a ser «cold».

💡 Consejo práctico

Si la primera respuesta parece "bloqueada", espera — probablemente sea solo la primera carga. La velocidad depende de tu hardware: cuanto más rápida sea la memoria y el chip, más rápido carga y responde. Usa ollama ps para ver si el modelo está cargado en este momento.

Conceptos clave

1er inicio

Cargar el modelo del disco a la RAM.

Cold vs hot

Frío (cargando) es lento; caliente (en la RAM) es rápido.

ollama ps

Muestra qué modelo está cargado ahora.

Depende del hardware

La velocidad es la de tu máquina.

6

🗑️ Gestionar modelos

Como los modelos son gratis, vas a probar varios, y cada uno ocupa gigabytes. Tres comandos se encargan de eso: ollama list muestra lo que tú descargó, ollama ps muestra lo que está en ejecución ahora, e ollama rm elimina un modelo para liberar espacio en el disco.

🎯 Code-run: listar, ver y eliminar

Objetivo: ver tus modelos y borrar uno que ya no usas. Pega según lo necesites:

ollama list          # o que voce baixou (nome + tamanho)
ollama ps            # o que esta carregado na memoria agora
ollama rm <modelo>    # apaga; ex.: ollama rm qwen3:30b-a3b-q4_K_M

Cómo verificar: después del rm, ejecuta ollama list de nuevo: el modelo eliminado desaparece de la lista y se libera el espacio en disco.

Atención: cambia <modelo> por el nombre exacto de lo que aparece en el ollama list. O rm elimina de verdad — para volver a usarlo, tienes que descargarlo (pull) otra vez.

✈️ Verificación final: ¿responde sin conexión?

Prueba de que es realmente local: desconecta el wifi, ejecuta ollama run qwen3:30b-a3b-q4_K_M y haz una pregunta. Si responde sin internet, confirmaste que la inteligencia está en TU máquina: exactamente lo que promete el curso.

Conceptos clave

ollama list

Lista los modelos descargados y sus tamaños.

ollama ps

Muestra lo que está cargado en la memoria.

ollama rm

Elimina un modelo y libera espacio en disco.

Sin conexión

Sin internet, el modelo sigue respondiendo.

Autocomprobación (opcional): estás conversando en la terminal y quieres terminar la conversación y volver a la terminal normal. ¿Qué escribes?

🎯 Resumen del módulo

✓
Descargar — ollama pull qwen3:30b-a3b-q4_K_M lleva el modelo (~18 GB) al disco, una sola vez.
✓
Conversar — ollama run ... abre el chat en la terminal; /bye termina. O usa la app.
✓
Thinking y primera carga — "Thought for X s" es el razonamiento; la primera respuesta tarda por la carga en la RAM.
✓
Gestionar es sin conexión — list/ps/rm se encargan de los modelos; sin wifi, igual responde.

Siguiente módulo:

2.4 — El modelo del agente: Qwen 3 Coder 64k