💬 Descargar y conversar con tu 1.er modelo
Llegó la hora del «¡guau!»: vamos a descargar un modelo de verdad, abrir un chat y ver cómo responde la IA en tu máquina. Dos comandos bastan: uno para descargar, otro para conversar — y al final desconectas Internet y el modelo sigue respondiendo.
⬇️ Descargar el modelo
Con Ollama ya instalado (módulo 2.1) y el modelo elegido (módulo 2.2), el primer paso es descargar el modelo en tu disco. Vamos a usar qwen3:30b-a3b-q4_K_M — el modelo "rápido" recomendado, con cerca de 18 GB. La descarga es la única etapa que requiere internet; después de eso, el modelo funciona 100% sin conexión.
🎯 Code-run: descargar el modelo
Objetivo: llevar el modelo rápido a tu disco. Pega en la terminal:
ollama pull qwen3:30b-a3b-q4_K_M
Cómo verificar: aparece una barra de progreso hasta success. Después, ollama list debe mostrar el modelo en la lista.
¿Nuevo por aquí? "Pull" (descargar) es el término de Ollama (tomado de Git/Docker) para descargar un modelo del repositorio oficial para tu computadora. El nombre qwen3:30b-a3b-q4_K_M y la «etiqueta»: qwen3 = familia, 30b = 30 mil millones de parámetros, a3b = arquitectura, q4_K_M = nivel de cuantización (compresión).
Conceptos clave
El comando que descarga un modelo en tu disco.
El tamaño de qwen3:30b-a3b-q4_K_M; necesita espacio en disco.
Solo usa internet una vez; después funciona sin conexión.
familia:tamaño-arquitectura-cuantizacion.
💬 Conversar en la terminal
Modelo descargado, hora de conversar. El comando ollama run abre un chat dentro de la propia terminal: escribes, presionas Enter y el modelo responde ahí mismo. Para salir de la conversación, escribe /bye.
🎯 Code-run: conversar en la terminal
Objetivo: abrir un chat con el modelo y hacer la primera pregunta. Pega:
ollama run qwen3:30b-a3b-q4_K_M
>>> Explique em uma frase o que e uma janela de contexto.
... (a resposta aparece aqui) ...
>>> /bye
Cómo verificar: el prompt cambia a >>> y el modelo responde. /bye te devuelve a la terminal normal.
De izquierda a derecha: pull descarga una vez, run abre el chat y conversas en el prompt >>> e /bye termina. Solo el «pull» necesita internet.
💡 Consejo práctico
Si ejecutas ollama run con un modelo que aún no descargaste, Ollama lo descarga automáticamente antes de abrir el chat. Pero separar el pull (descarga) del run (conversar) deja más claro lo que está pasando.
Conceptos clave
Abre un chat con el modelo en la terminal.
Dónde escribes tus preguntas.
Sal de la conversación y vuelve a la terminal.
run descarga el modelo si todavía no existe.
🖼️ Conversar en la app
¿No te gusta la terminal? No hay problema. La app de Ollama tiene una ventana de chat parecida a cualquier app de mensajería: eliges el modelo de una lista y conversas con el mouse y el teclado, sin escribir comandos. El motor de fondo es el mismo; solo cambia la interfaz.
qwen3:30b-a3b-q4_K_M de la terminal; la app y la terminal comparten los modelos descargados, así que no tienes que descargarlos dos veces.✓ Cuándo destaca la app
- ✓Quien prefiere hacer clic en lugar de escribir comandos.
- ✓Conversaciones largas, con historial desplazable.
- ✓Cambiar de modelo desde un menú, sin memorizar etiquetas.
- ✓Mostrarle a alguien sin asustarlo con la terminal.
✗ Cuándo gana la terminal
- ✗Automatizar (scripts, pipelines).
- ✗Ver mensajes de error detallados.
- ✗Ejecutar comandos como pull/list/rm directamente.
- ✗Conectar al agente (Hermes se comunica mediante un servicio/terminal).
Conceptos clave
Interfaz gráfica de Ollama.
Los modelos descargados aparecen para seleccionarlos.
La app y el terminal usan los mismos modelos.
Conversación sin escribir nada en la terminal.
🧠 El «thinking»
Notarás que, antes de responder, el modelo a veces muestra algo como "Thought for 6.2 seconds". Eso es el thinking (razonamiento): los modelos modernos «piensan» en silencio antes de escribir la respuesta final. Este paso adicional suele hacer que la respuesta sea más correcta, a cambio de un poco más de tiempo.
📊 Qué cambia el «thinking»
- •Mejores respuestas: razonar antes reduce los errores en tareas difíciles.
- •Un poco más lento: los segundos de "Thought for..." son el costo del razonamiento.
- •Configurable: en Hermes, los interruptores Thinking/Fast te permiten priorizar la calidad o la velocidad.
¿Nuevo por aquí? "Thinking" (o "reasoning") es cuando el modelo genera un borrador de razonamiento interno antes de la respuesta final. Ves la etiqueta del tiempo, pero el borrador suele quedar oculto. Los modelos con thinking tienden a acertar más en lógica, matemáticas y código.
Conceptos clave
Razonamiento interno antes de la respuesta.
El tiempo que el modelo pasó pensando.
Pensar más permite acertar más, pero toma un poco más de tiempo.
Opciones de Hermes para elegir el equilibrio.
⏱️ La velocidad y la primera carga
A primera una pregunta después de abrir el modelo suele tardar más. Eso es el 1er inicio (carga inicial): Ollama necesita cargar los 18 GB del modelo del disco a la memoria. A partir de la segunda pregunta, con el modelo ya "caliente" en la RAM, las respuestas salen mucho más rápido.
Cold start (1.ª vez)
El modelo se carga del disco a la RAM — la primera respuesta tarda más.
Modelo en caliente
Una vez en la memoria, las siguientes respuestas llegan rápido.
Se descarga solo
Después de un tiempo sin actividad, Ollama libera la RAM; entonces la siguiente vuelve a ser «cold».
💡 Consejo práctico
Si la primera respuesta parece "bloqueada", espera — probablemente sea solo la primera carga. La velocidad depende de tu hardware: cuanto más rápida sea la memoria y el chip, más rápido carga y responde. Usa ollama ps para ver si el modelo está cargado en este momento.
Conceptos clave
Cargar el modelo del disco a la RAM.
Frío (cargando) es lento; caliente (en la RAM) es rápido.
Muestra qué modelo está cargado ahora.
La velocidad es la de tu máquina.
🗑️ Gestionar modelos
Como los modelos son gratis, vas a probar varios, y cada uno ocupa gigabytes. Tres comandos se encargan de eso: ollama list muestra lo que tú descargó, ollama ps muestra lo que está en ejecución ahora, e ollama rm elimina un modelo para liberar espacio en el disco.
🎯 Code-run: listar, ver y eliminar
Objetivo: ver tus modelos y borrar uno que ya no usas. Pega según lo necesites:
ollama list # o que voce baixou (nome + tamanho)
ollama ps # o que esta carregado na memoria agora
ollama rm <modelo> # apaga; ex.: ollama rm qwen3:30b-a3b-q4_K_M
Cómo verificar: después del rm, ejecuta ollama list de nuevo: el modelo eliminado desaparece de la lista y se libera el espacio en disco.
Atención: cambia <modelo> por el nombre exacto de lo que aparece en el ollama list. O rm elimina de verdad — para volver a usarlo, tienes que descargarlo (pull) otra vez.
✈️ Verificación final: ¿responde sin conexión?
Prueba de que es realmente local: desconecta el wifi, ejecuta ollama run qwen3:30b-a3b-q4_K_M y haz una pregunta. Si responde sin internet, confirmaste que la inteligencia está en TU máquina: exactamente lo que promete el curso.
Conceptos clave
Lista los modelos descargados y sus tamaños.
Muestra lo que está cargado en la memoria.
Elimina un modelo y libera espacio en disco.
Sin internet, el modelo sigue respondiendo.
Autocomprobación (opcional): estás conversando en la terminal y quieres terminar la conversación y volver a la terminal normal. ¿Qué escribes?
🎯 Resumen del módulo
ollama pull qwen3:30b-a3b-q4_K_M lleva el modelo (~18 GB) al disco, una sola vez.ollama run ... abre el chat en la terminal; /bye termina. O usa la app.list/ps/rm se encargan de los modelos; sin wifi, igual responde.Siguiente módulo:
2.4 — El modelo del agente: Qwen 3 Coder 64k