💬 Proyecto 1: Chat privado 100% local
Se acabó la teoría. Este es tu primer proyecto de principio a fin: crear un chat de IA que funcione completamente en tu máquina, responda con internet desconectado y además te permita bifurcar la conversación en dos líneas de razonamiento. Sigue los pasos: cada uno tiene un objetivo, instrucciones, cómo verificarlo y el resultado esperado.
El recorrido del proyecto en una línea: desde pull del modelo hasta el chat privado, pasando por la prueba sin conexión — el momento que demuestra que todo se ejecuta en tu máquina.
🎯 Objetivo: conversar 100 % sin conexión
La meta de este proyecto es simple y poderosa: tener un chat de IA que funciona sin internet, ejecutándose completamente en tu computadora. Ningún mensaje sale de la máquina, no hay medidor de costos y la IA sigue disponible incluso sin conexión. Es la prueba más directa de todo lo que viste en las Rutas 1 y 2.
🧭 Qué tendrás al final
- •Un modelo abierto descargado y listo en tu máquina.
- •Un chat funcionando en la terminal o en la app de Ollama.
- •La prueba viviente de que responde con el wifi apagado.
- •Una conversación dividida en dos líneas de razonamiento.
¿Nuevo por aquí? "Offline" quiere decir que no hay ninguna conexión a internet. Como el modelo y tus datos están en tu disco, el chat no necesita pedirle nada a un servidor; por eso funciona en el avión, en el campo o cuando se cae la red.
Conceptos clave
La conversación ocurre en tu máquina, de principio a fin.
Funciona sin internet: la IA está en tu disco.
Después de la descarga, cada conversación es gratuita.
Nada de lo que escribes sale de la computadora.
⬇️ Asegurar un modelo en la máquina
Objetivo de la etapa: tener descargado en el disco el modelo rápido del curso. Sin un modelo local, no hay nada que ejecutar sin conexión. Vas a usar el Qwen 3 30B-A3B en la versión cuantizada (más ligera), que es el «modelo rápido» que se muestra en el video.
🎯 Paso a paso
- Abre la terminal (o usa la app de Ollama, instalada en la Ruta 2).
- Ejecuta el comando pull de abajo para descargar el modelo (≈18 GB).
- Espera a que la barra de progreso llegue al 100%.
Comando para pegar (objetivo: descargar el modelo):
ollama pull qwen3:30b-a3b-q4_K_M
Cómo verificar (el modelo aparece en la lista):
ollama list
# saida esperada (exemplo):
# NAME SIZE
# qwen3:30b-a3b-q4_K_M 18 GB
💡 Consejo práctico
El fragmento q4_K_M y es el nivel de cuantización (el modelo «reducido» para que quepa mejor en la memoria). Si tu máquina tiene poca RAM, conviene descargar primero un modelo más pequeño, probarlo y borrarlo con ollama rm <modelo>. Explorar es barato.
Conceptos clave
Descarga el modelo en tu disco.
El q4_K_M hace que el modelo sea más pequeño y ligero.
Confirma que el modelo está en la máquina.
Descárgalo una vez; después ejecútalo sin conexión.
💬 Abrir el chat (terminal o app)
Objetivo de la etapa: iniciar la conversación. Tienes dos caminos para el mismo modelo: el terminal (rápido y directo) y el app de Ollama (con ventana de chat). Elige lo que te resulte más cómodo; ambos usan exactamente el mismo modelo local.
✓ Ruta por terminal
- ✓Rápido y siempre disponible.
- ✓Funciona en cualquier SO.
- ✓Salida del chat con
/bye.
🖼️ Ruta de la app
- •Ventana de chat amigable.
- •Bueno para quien no disfruta usar la terminal.
- •Elige el modelo de la lista de la app.
Comando para pegar (objetivo: abrir el chat en la terminal):
ollama run qwen3:30b-a3b-q4_K_M
# o prompt fica aguardando voce digitar.
# experimente: "explique em 2 linhas o que e teoria das cores"
# para sair do chat, digite: /bye
Cómo verificar: el modelo responde a tu primera pregunta. La primera vez puede tardar un poco más (mientras se carga en la memoria); es normal.
¿Nuevo por aquí? ollama run hace dos cosas: si el modelo no está cargado, lo carga en la memoria; después abre un chat en la propia terminal. Puedes usar run directamente sin haber hecho el pull antes: se descarga automáticamente; pero separar las etapas hace que el proceso sea más claro.
Conceptos clave
Carga el modelo y abre el chat en la terminal.
Sal del chat de la terminal.
El mismo modelo, con interfaz gráfica.
La primera respuesta tarda más (se está cargando el modelo).
✈️ Probar sin conexión (el momento de la verdad)
Objetivo de la etapa: demostrar, sin dejar dudas, que el chat no depende de la nube. Vas a desconectar internet y haz otra pregunta. Si el modelo responde, queda demostrado: la inteligencia está en tu máquina.
Con el chat abierto, desconecta el wifi
Desconecta la red (apaga el wifi o desconecta el cable). En el video, es literalmente «desconectar el cable».
Haz una nueva pregunta
Pregunta lo que quieras. Ej.: «resume la teoría del color en 3 puntos».
Mira cómo llega la respuesta
El modelo responde con normalidad, sin conexión. Prueba completada.
A la izquierda, sin conexión de red, la llamada al el servidor falla; a la derecha, el el modelo local responde incluso sin conexión — exactamente lo que acabas de probar.
Por qué esto importa: esta prueba es lo que transforma «creo que es local» en «vi que funciona». En un vuelo, en un lugar sin señal o cuando la red falla, tu chat sigue funcionando.
Conceptos clave
La prueba de que nada depende de la nube.
La IA siempre está ahí, sin depender de la red.
Sin conexión, los datos no tienen por dónde salir.
Una caída de la red no te paraliza.
🌿 Bifurcar la conversación en dos líneas
Objetivo de la etapa: aprender a crear un fork (rama) de una conversación para explorar dos caminos desde el mismo punto, sin perder el original. En la app de Hermes esto aparece en la lista de Sessions, con conversaciones ramificadas.
🎯 Cómo hacerlo (acción en la interfaz)
- Ten una conversación en curso.
- Elige el mensaje desde el que quieres ramificar.
- Crea su fork/branch (la UI muestra las Sessions resultantes).
- Haz una pregunta diferente en cada rama y compara.
Cómo verificar: hay dos líneas de conversación que parten del mismo mensaje, una al lado de la otra en Sessions.
📊 Cuándo ayuda hacer un fork
- •Probar dos tonos de respuesta (formal vs. informal) sin rehacerlo todo.
- •Explorar dos soluciones para el mismo problema en paralelo.
- •Guardar la conversación original como "fuente de la verdad".
¿Nuevo por aquí? "Forkear" (o "branch") viene del mundo del código: crear una rama a partir de un punto en común. En una conversación, es abrir una copia que sigue otro camino, sin borrar la original.
Conceptos clave
Una rama de la conversación a partir de un punto en común.
La lista de conversaciones, incluidas las ramificadas.
Dos respuestas a partir del mismo mensaje.
Permanece intacta; el fork no la borra.
✅ Resultado: chat privado sin internet
Resultado esperado: tienes un chat de IA que es tu — privado, gratuito y que funciona en cualquier lugar. Es el primer "esto sí es realmente mío" del curso, y la base sobre la que el Proyecto 2 montará el Agente Hermes completo en Vault.
🧾 Lista de verificación de finalización
ollama list muestra el modelo descargado.ollama run) o desde la aplicación.⚠️ ¿Salió mal?
- ✗"Command not found": vuelve a abrir la terminal o revisa el PATH (visto en el Módulo 2.1).
- ✗Muy lento o se traba: quizá el modelo sea demasiado grande para tu RAM; prueba con uno más pequeño.
- ✗"No responde sin conexión": confirma que la descarga terminó (100%) antes de desconectar la red.
Autocomprobación (opcional): ¿cuál es la PRUEBA de que el chat es 100% local?
🎯 Resumen del proyecto
ollama pull e ollama run llevan el modelo y abren la conversación.Siguiente proyecto:
3.2 — Agente Hermes ejecutándose localmente (Vault de principio a fin): del chat al agente completo, 100% privado.