PTENES
MÓDULO 3.1 · PROYECTO

💬 Proyecto 1: Chat privado 100% local

Se acabó la teoría. Este es tu primer proyecto de principio a fin: crear un chat de IA que funcione completamente en tu máquina, responda con internet desconectado y además te permita bifurcar la conversación en dos líneas de razonamiento. Sigue los pasos: cada uno tiene un objetivo, instrucciones, cómo verificarlo y el resultado esperado.

6
Etapas
~35
Minutos
Práctico
Nivel
Proyecto
Tipo
⬇️pull del modelo 💬abrir el chat ✈️probar sin conexión 🌿hacer fork ✅chat privado

El recorrido del proyecto en una línea: desde pull del modelo hasta el chat privado, pasando por la prueba sin conexión — el momento que demuestra que todo se ejecuta en tu máquina.

1

🎯 Objetivo: conversar 100 % sin conexión

La meta de este proyecto es simple y poderosa: tener un chat de IA que funciona sin internet, ejecutándose completamente en tu computadora. Ningún mensaje sale de la máquina, no hay medidor de costos y la IA sigue disponible incluso sin conexión. Es la prueba más directa de todo lo que viste en las Rutas 1 y 2.

🧭 Qué tendrás al final

  • •Un modelo abierto descargado y listo en tu máquina.
  • •Un chat funcionando en la terminal o en la app de Ollama.
  • •La prueba viviente de que responde con el wifi apagado.
  • •Una conversación dividida en dos líneas de razonamiento.

¿Nuevo por aquí? "Offline" quiere decir que no hay ninguna conexión a internet. Como el modelo y tus datos están en tu disco, el chat no necesita pedirle nada a un servidor; por eso funciona en el avión, en el campo o cuando se cae la red.

Conceptos clave

Chat local

La conversación ocurre en tu máquina, de principio a fin.

Sin conexión

Funciona sin internet: la IA está en tu disco.

$0 por uso

Después de la descarga, cada conversación es gratuita.

Privacidad

Nada de lo que escribes sale de la computadora.

2

⬇️ Asegurar un modelo en la máquina

Objetivo de la etapa: tener descargado en el disco el modelo rápido del curso. Sin un modelo local, no hay nada que ejecutar sin conexión. Vas a usar el Qwen 3 30B-A3B en la versión cuantizada (más ligera), que es el «modelo rápido» que se muestra en el video.

🎯 Paso a paso

  1. Abre la terminal (o usa la app de Ollama, instalada en la Ruta 2).
  2. Ejecuta el comando pull de abajo para descargar el modelo (≈18 GB).
  3. Espera a que la barra de progreso llegue al 100%.

Comando para pegar (objetivo: descargar el modelo):

ollama pull qwen3:30b-a3b-q4_K_M

Cómo verificar (el modelo aparece en la lista):

ollama list
# saida esperada (exemplo):
# NAME                       SIZE
# qwen3:30b-a3b-q4_K_M       18 GB
Conversación con el modelo Qwen ejecutándose localmente: el modelo muestra 'Thought for 6.2 seconds' antes de responder con datos sobre teoría del color
Fotograma del video: después del pull, este es el modelo con el que vas a conversar. Fíjate en "Thought for 6.2 seconds": el modelo "piensa" antes de responder; eso es normal y lo verás en el Módulo 3.1 etapa 5.

💡 Consejo práctico

El fragmento q4_K_M y es el nivel de cuantización (el modelo «reducido» para que quepa mejor en la memoria). Si tu máquina tiene poca RAM, conviene descargar primero un modelo más pequeño, probarlo y borrarlo con ollama rm <modelo>. Explorar es barato.

Conceptos clave

ollama pull

Descarga el modelo en tu disco.

Cuantización

El q4_K_M hace que el modelo sea más pequeño y ligero.

ollama list

Confirma que el modelo está en la máquina.

Descarga única

Descárgalo una vez; después ejecútalo sin conexión.

3

💬 Abrir el chat (terminal o app)

Objetivo de la etapa: iniciar la conversación. Tienes dos caminos para el mismo modelo: el terminal (rápido y directo) y el app de Ollama (con ventana de chat). Elige lo que te resulte más cómodo; ambos usan exactamente el mismo modelo local.

✓ Ruta por terminal

  • ✓Rápido y siempre disponible.
  • ✓Funciona en cualquier SO.
  • ✓Salida del chat con /bye.

🖼️ Ruta de la app

  • •Ventana de chat amigable.
  • •Bueno para quien no disfruta usar la terminal.
  • •Elige el modelo de la lista de la app.

Comando para pegar (objetivo: abrir el chat en la terminal):

ollama run qwen3:30b-a3b-q4_K_M
# o prompt fica aguardando voce digitar.
# experimente: "explique em 2 linhas o que e teoria das cores"
# para sair do chat, digite: /bye

Cómo verificar: el modelo responde a tu primera pregunta. La primera vez puede tardar un poco más (mientras se carga en la memoria); es normal.

¿Nuevo por aquí? ollama run hace dos cosas: si el modelo no está cargado, lo carga en la memoria; después abre un chat en la propia terminal. Puedes usar run directamente sin haber hecho el pull antes: se descarga automáticamente; pero separar las etapas hace que el proceso sea más claro.

Conceptos clave

ollama run

Carga el modelo y abre el chat en la terminal.

/bye

Sal del chat de la terminal.

App de Ollama

El mismo modelo, con interfaz gráfica.

1er inicio

La primera respuesta tarda más (se está cargando el modelo).

4

✈️ Probar sin conexión (el momento de la verdad)

Objetivo de la etapa: demostrar, sin dejar dudas, que el chat no depende de la nube. Vas a desconectar internet y haz otra pregunta. Si el modelo responde, queda demostrado: la inteligencia está en tu máquina.

1

Con el chat abierto, desconecta el wifi

Desconecta la red (apaga el wifi o desconecta el cable). En el video, es literalmente «desconectar el cable».

2

Haz una nueva pregunta

Pregunta lo que quieras. Ej.: «resume la teoría del color en 3 puntos».

3

Mira cómo llega la respuesta

El modelo responde con normalidad, sin conexión. Prueba completada.

NUBE · sin internet tú servidorinalcanzable LOCAL · sin internet tú modelo localresponde ✓

A la izquierda, sin conexión de red, la llamada al el servidor falla; a la derecha, el el modelo local responde incluso sin conexión — exactamente lo que acabas de probar.

Por qué esto importa: esta prueba es lo que transforma «creo que es local» en «vi que funciona». En un vuelo, en un lugar sin señal o cuando la red falla, tu chat sigue funcionando.

Conceptos clave

Prueba sin conexión

La prueba de que nada depende de la nube.

Disponibilidad

La IA siempre está ahí, sin depender de la red.

Airgapped

Sin conexión, los datos no tienen por dónde salir.

Resiliencia

Una caída de la red no te paraliza.

5

🌿 Bifurcar la conversación en dos líneas

Objetivo de la etapa: aprender a crear un fork (rama) de una conversación para explorar dos caminos desde el mismo punto, sin perder el original. En la app de Hermes esto aparece en la lista de Sessions, con conversaciones ramificadas.

Pantalla de Hermes con la lista de Sessions y conversaciones fijadas (Pinned), que muestra una conversación que se bifurca en dos líneas (branch/fork)
Fotograma del video: fíjate en la lista de Sessions a la izquierda. Hacer un fork significa tomar un mensaje y abrir un segundo camino a partir de él: conservas intacta la conversación original y creas una "versión alternativa" para comparar respuestas.

🎯 Cómo hacerlo (acción en la interfaz)

  1. Ten una conversación en curso.
  2. Elige el mensaje desde el que quieres ramificar.
  3. Crea su fork/branch (la UI muestra las Sessions resultantes).
  4. Haz una pregunta diferente en cada rama y compara.

Cómo verificar: hay dos líneas de conversación que parten del mismo mensaje, una al lado de la otra en Sessions.

📊 Cuándo ayuda hacer un fork

  • •Probar dos tonos de respuesta (formal vs. informal) sin rehacerlo todo.
  • •Explorar dos soluciones para el mismo problema en paralelo.
  • •Guardar la conversación original como "fuente de la verdad".

¿Nuevo por aquí? "Forkear" (o "branch") viene del mundo del código: crear una rama a partir de un punto en común. En una conversación, es abrir una copia que sigue otro camino, sin borrar la original.

Conceptos clave

Fork / branch

Una rama de la conversación a partir de un punto en común.

Sessions

La lista de conversaciones, incluidas las ramificadas.

Comparar caminos

Dos respuestas a partir del mismo mensaje.

Conversación original

Permanece intacta; el fork no la borra.

6

✅ Resultado: chat privado sin internet

Resultado esperado: tienes un chat de IA que es tu — privado, gratuito y que funciona en cualquier lugar. Es el primer "esto sí es realmente mío" del curso, y la base sobre la que el Proyecto 2 montará el Agente Hermes completo en Vault.

🧾 Lista de verificación de finalización

✓ollama list muestra el modelo descargado.
✓El chat respondió por la terminal (ollama run) o desde la aplicación.
✓Volvió a responder con Internet desconectado.
✓Hiciste un fork de la conversación en dos líneas.

⚠️ ¿Salió mal?

  • ✗"Command not found": vuelve a abrir la terminal o revisa el PATH (visto en el Módulo 2.1).
  • ✗Muy lento o se traba: quizá el modelo sea demasiado grande para tu RAM; prueba con uno más pequeño.
  • ✗"No responde sin conexión": confirma que la descarga terminó (100%) antes de desconectar la red.

Autocomprobación (opcional): ¿cuál es la PRUEBA de que el chat es 100% local?

🎯 Resumen del proyecto

✓
Objetivo cumplido — un chat de IA 100 % local, privado y gratuito.
✓
Modelo + chat — ollama pull e ollama run llevan el modelo y abren la conversación.
✓
Prueba sin conexión — respondió con la red desconectada: la inteligencia está en tu máquina.
✓
Bifurcación de conversación — exploras dos caminos sin perder el original.

Siguiente proyecto:

3.2 — Agente Hermes ejecutándose localmente (Vault de principio a fin): del chat al agente completo, 100% privado.