🛠️ Manos a la obra
Se acabó la teoría: es hora de instalar. Vas a instalar Ollama en tu computadora, elegir un modelo que quepa en tu hardware, descargarlo y conversar con él, preparar el modelo del agente (Qwen 3 Coder con 64k de contexto) y conectar todo al Agente Hermes: escritorio, terminal o Telegram. Cada módulo incluye comandos listos para copiar y pegar.
Los cuatro pasos prácticos de esta trilha, de izquierda a derecha: instalar Ollama, descargar un modelo, crear la versión de 64k y conectar todo al Agente Hermes — llegando a un agente que funciona 100% en tu máquina.
Mapa de la ruta
⬇️ Instalar Ollama
Un comando y listo
🎚️ El modelo adecuado
Que quepa en tu hardware
💬 Tu 1.er modelo
Descargar y conversar
🪟 El modelo del agente
Qwen 3 Coder 64k
🔌 Conectarte a Hermes
Modelo local conectado
🖥️ Escritorio y Telegram
Tres formas de hablar
Contenido detallado
⬇️ Instalar Ollama
El primer paso práctico: descargar Ollama del sitio, instalarlo desde la terminal (Mac/Linux) o con el instalador (Windows) y comprobar que todo funcionó, con comandos listos para copiar y pegar.
Empiezas en el sitio oficial ollama.com, donde está el botón Download y el comando de instalación.
Descargarlo de la fuente oficial evita versiones falsas y garantiza el instalador correcto para tu sistema.
Fuente oficial, descarga, detección del sistema.
En Mac/Linux, un solo comando (curl ... | sh) descarga e instala Ollama de una vez.
Es la forma más rápida y la que de verdad vas a pegar, sin hacer clic en pantallas.
curl, pipe a sh, script de instalación.
En Windows (y también en Mac), puedes descargar el instalador desde el sitio y hacer clic para instalarlo.
Si no te gusta usar la terminal, este es el camino sin línea de comandos.
Instalador gráfico, app de bandeja.
Ejecutar ollama --version y ollama list confirma que está instalado y responde.
Verificar antes de continuar evita perder tiempo después con el error de "comando no encontrado".
Verificación, --version, lista vacía.
Ollama tiene una app con ventana y también comandos de terminal: hacen lo mismo.
Saber que existen ambas opciones te permite elegir la que te resulte más cómoda.
GUI vs CLI, el mismo motor por debajo.
El error más común es que la terminal no "vea" ollama recién instalado — basta con volver a abrir la terminal.
Resuelve el 90% de los problemas de instalación sin tener que reinstalar nada.
PATH, vuelve a abrir la terminal, inicia una sesión nueva.
🎚️ Elegir el modelo adecuado para tu hardware
Antes de descargar gigabytes, averigua qué soporta tu máquina: consulta el hardware, pídele una recomendación a Hermes, entiende los niveles de esfuerzo y la regla de dejar RAM libre.
Revisa cuánta memoria (RAM) y qué chip tienes; en Mac, en «Acerca de esta Mac».
La RAM es lo que determina qué modelo cabe; sin eso, descargas a ciegas.
RAM, chip/GPU, "Sobre este Mac".
Le muestras tu hardware a Hermes y te sugiere modelos compatibles (ej.: M4 Max 36GB → Qwen 32B / 30B-A3B).
Elimina las conjeturas al elegir; el propio agente ya te indica el camino.
Recomendación según el hardware, opciones por tamaño.
En el selector de Hermes ajustas el esfuerzo (Minimal, Low, Medium, High, Max) y activas o desactivas Thinking/Fast.
Así equilibras calidad y velocidad sin cambiar de modelo.
Effort, Thinking, Fast.
El modelo debe caber en la RAM y dejar espacio para el resto del sistema; si está demasiado lleno, la máquina se bloquea.
Evita el error clásico de elegir el modelo más grande y que la máquina se atasque.
Headroom, margen de RAM, descargar→probar→borrar.
El sufijo q4_K_M indica un modelo cuantizado (comprimido), que ocupa menos memoria.
Entender la cuantización te permite usar modelos más grandes con la misma RAM.
Cuantización, q4_K_M, tamaño vs. precisión.
Una recomendación concreta para empezar: qwen3:30b-a3b-q4_K_M, rápido y equilibrado.
Empezar con un modelo probado evita la parálisis por tener que elegir.
Primer modelo, qwen3:30b-a3b-q4_K_M.
💬 Descargar y conversar con tu 1.er modelo
El momento «¡guau!»: descargar el modelo, ejecutarlo en la terminal o en la app, entender el «thinking» y administrar lo que está en el disco: todo funciona sin conexión en tu máquina.
El comando ollama pull descarga el modelo elegido (unos 18 GB) en tu disco, con barra de progreso.
Y es el único momento que necesita internet; después funciona sin conexión.
pull, descarga única, barra de progreso.
ollama run abre un chat en la propia terminal; escribes, responde y sales con /bye.
Es la forma más directa de demostrar que el modelo local funciona.
run, prompt en la terminal, /bye.
La app de Ollama tiene una ventana de chat; elige el modelo de la lista y conversa como en una app común.
Es el camino cómodo para quienes prefieren el mouse al teclado.
App de chat, selector de modelo.
Los modelos de razonamiento «piensan» antes de responder; la app muestra algo como «Thought for 6.2 seconds».
Explica por qué la respuesta tarda un poco y por qué suele ser mejor.
Thinking, razonamiento, tiempo para «pensar».
En la primera pregunta, el modelo se carga en la memoria y tarda más; después va más rápido.
Saber esto evita pensar que "se quedó bloqueado" desde el principio.
Cold start, cargar en RAM, calentamiento.
ollama list muestra lo que descargaste, ollama ps lo que está en ejecución, ollama rm borra un modelo.
Probarás varios; eliminar los que no usas libera espacio en disco.
list, ps, rm, limpieza de disco.
🪟 El modelo del agente: Qwen 3 Coder 64k
El agente exige 64k de contexto. Entenderás por qué, conocerás Qwen 3 Coder, escribirás un Modelfile que aumenta el num_ctx y crearás el modelo derivado de 64k con un comando.
El Agente Hermes necesita un modelo con 64.000 tokens de contexto; el del módulo 2.3 no siempre lo tiene.
Es el motivo para preparar un modelo específico antes de conectar el agente.
Requisito de 64k, modelo del agente.
Un modelo abierto de la familia Qwen orientado a la programación y al uso de herramientas: ideal para un agente.
Saber por qué se lo elige te ayuda a cambiarlo con criterio más adelante.
Qwen 3 Coder, modelo p/ agente, tools.
Un Modelfile es una receta breve: parte de un modelo base y ajusta el num_ctx a 65536 (64k).
Así es como «fabricas» el modelo de 64k a partir de uno que ya tienes.
Modelfile, FROM, PARAMETER num_ctx 65536.
ollama create qwen3-coder-64k -f Modelfile genera un nuevo modelo con el contexto ya en 64k.
Este modelo derivado es el que vas a indicarle a Hermes en el módulo 2.5.
create, modelo derivado, -f Modelfile.
ollama show qwen3-coder-64k y ollama list confirman que el modelo existe y tiene 64k.
Verificar antes de conectarlo al agente evita errores de contexto más adelante.
show, list, verificar el num_ctx.
Un contexto más grande consume más RAM; 64k ocupa más que el contexto predeterminado del mismo modelo.
Vuelve a activar la regla del headroom: necesitas holgura para ejecutar el agente.
Costo de memoria del contexto, margen disponible.
🔌 Conectar el modelo local al Agente Hermes
La conexión final: instalar/actualizar Hermes (open-source, MIT, Nous Research), seleccionar el modelo local de 64k, diagnosticar y probar la conexión con todo funcionando 100% sin conexión.
Hermes Agent es el «SO de IA» open source de Nous Research, con licencia MIT.
Open-source + MIT = puedes ejecutar, auditar y adaptar sin ataduras.
Open-source, licencia MIT, Nous Research.
hermes update deja Hermes en la última versión; al terminar aparece "HERMES IS READY".
Empezar con la versión actualizada evita errores que ya se corrigieron.
hermes update, "HERMES IS READY".
En el selector de Hermes eliges qwen3-coder-64k; el modelo activo aparece en la esquina inferior derecha.
Es el paso que hace que el agente use TU modelo local en vez de la nube.
Selector de modelo, esquina inferior derecha.
Hermes solo funciona bien con el modelo de 64k; por eso preparaste el derivado antes.
Cierra el círculo: el módulo 2.4 existe exactamente para este momento.
Exigencia de contexto, modelo adecuado.
hermes doctor revisa el estado de la instalación y hermes status muestra el estado actual.
Son tus primeros comandos cuando algo no se conecta.
hermes doctor, hermes status.
Envía un «hola» en Hermes con el modelo local seleccionado y comprueba que la respuesta viene de tu máquina.
Es la prueba final de que el agente está funcionando 100% localmente.
Prueba de humo, respuesta local.
🖥️ App de escritorio, terminal y Telegram
Tres formas de hablar con Hermes: la aplicación de escritorio (amigable), la terminal (potente) y Telegram (desde cualquier lugar), además de las sesiones, branch/fork y artifacts.
Una ventana de aplicación de Hermes, más amigable que la terminal para quien está empezando.
Es el camino con menos fricción para usar el agente en el día a día.
App de escritorio, interfaz gráfica.
Desde la terminal ejecutas hermes dashboard, hermes setup y los demás comandos del agente.
La terminal es el camino más potente y automatizable.
hermes dashboard, hermes setup.
Puedes conversar con el agente por Telegram, como quien le envía un mensaje a un contacto.
Y es lo que te permite usar el agente desde el celular, desde cualquier lugar (Proyecto 7 de la Ruta 3).
Telegram, acceso remoto, chat.
Cada conversación es una "session"; abres New session y Hermes guarda el historial.
Organizar por sesiones mantiene los contextos separados (trabajo, estudio, etc.).
Session, New session, historial.
Puedes hacer un "fork" de una conversación en un punto y seguir por dos caminos distintos.
Permite probar enfoques sin perder la línea original.
Branch, fork, líneas paralelas.
Los resultados del agente (código, textos, archivos) se pueden guardar y volver a consultar como artifacts.
Y es donde «queda» el trabajo del agente, listo para usar después.
Artifacts, resultados guardados, reutilización.