PTENES
MÓDULO 1.7

💻 Local y privado

Ejecutar el MODELO en tu máquina, no solo Hermes. La contrapartida: estás limitado por el hardware, pero ganas privacidad total y funcionamiento sin conexión: a 1000 ft bajo tierra, volando o en el espacio.

Gemma (pequeño)hardware: ligero Qwen 32Bhardware: medio el más grande que cabelímite de TU hardware modelos gigantesnecesitan un centro de datos 🔒 privado + sin conexión
6
Temas
24
Minutos
Básico
Nivel
Práctico
Tipo
1

🏠 El modelo en tu máquina

Presta atención a la diferencia con el módulo 1.4: allí, el Hermes se ejecutaba localmente. Aquí, el propio MODELO de IA se ejecuta en tu máquina — nada tiene que salir de tu computadora.

🧬 Qué cambia

  • •Antes: el cerebro estaba en un servidor remoto (API/OAuth)
  • •Ahora: el cerebro funciona dentro de tu máquina
  • •Consecuencia: privacidad total y funcionamiento offline

💡 Consejo práctico

"Local-hosted" puede significar dos niveles: Hermes local (1.4) y el modelo local (este módulo). El segundo es el que garantiza privacidad absoluta.

2

⚖️ La compensación: limitado por el hardware

Los modelos grandes tienen miles de millones de parámetros y necesitan un centro de datos. En local, tú eres limitado por tu hardware — la privacidad cuesta rendimiento y velocidad.

✓ Lo que ganas

  • ✓Privacidad 100 %: nada sale de la máquina
  • ✓Funciona sin conexión
  • ✓Sin costo por token

✗ A qué renuncias

  • ✗Menos rendimiento que los servidores enormes
  • ✗Menos velocidad
  • ✗Límite definido por tu hardware
3

📐 Cómo dimensionar

No adivines lo que cabe. Ve a Apple → Acerca de esta Mac, envíale una captura de pantalla a Hermes y pregúntale: "¿cuál es el modelo local más potente que puedo ejecutar?".

1

Abre «Sobre esta Mac»

Menú Apple → Acerca de esta Mac. Ahí están la memoria, el chip y las especificaciones.

2

Envíale la captura de pantalla a Hermes

Lee las especificaciones visualmente y entiende lo que tu máquina puede soportar.

3

Pregunta cuál es el modelo ideal

"¿Cuál es el modelo local más potente que puedo ejecutar?" — lo recomienda.

💡 Consejo práctico

Dejar que Hermes lea tus especificaciones evita el error de descargar un modelo demasiado grande que bloquee la máquina.

4

🦙 Descargar mediante Ollama

La herramienta predeterminada para ejecutar modelos localmente es Ollama. Ejemplos: Gemma, Qwen 32B/3.6, u opciones gratuitas en la nube.

Descargar y ejecutar (ilustrativo)

$ ollama pull gemma       # modelo pequeno, leve
$ ollama pull qwen:32b    # mais potente, exige mais RAM
$ ollama run gemma        # conversa local, offline

📊 Opciones comunes

  • •Gemma — ligero, buen punto de partida
  • •Qwen 32B / 3.6 — más potente, requiere más hardware
  • •Cloud gratis — cuando el entorno local no da abasto
5

🔒 100% privado y offline

Como todo funciona localmente, es 100% privado y funciona sin conexión: a 1000 ft bajo tierra, volando en un avión o incluso en el espacio.

⛏️
1000 ft abajo
✈️
En marcha
🚀
En el espacio

🛡️ El gran argumento a favor de lo local

Nada sale de tu máquina. Para quienes manejan datos sensibles o necesitan operar sin conexión, esa es la diferencia entre poder usar IA o no.

  • •Sin dependencia de internet
  • •Ningún dato se envía a servidores externos
6

🧭 Cuándo vale la pena

Lo local vale la pena cuando la privacidad o la operación sin conexión son innegociables. Para obtener la máxima potencia, los modelos en la nube todavía ganan; es una decisión de prioridades.

✓ Prefiere el modo local cuando

  • ✓La privacidad es innegociable
  • ✓Necesitas que funcione sin internet
  • ✓Quieres costo cero por uso

✗ Prefiere la nube cuando

  • ✗Necesitas máxima potencia/velocidad
  • ✗Tu hardware es limitado
  • ✗La tarea requiere el mejor modelo posible

Cierra la Ruta 1: ya sabes qué es un agente, qué es Hermes, dónde vive, cómo conectar modelos y cómo ejecutar todo localmente. La Trilha 2 aborda las capacidades (memoria, soul, MCPs).

7

🧯 Errores comunes al ejecutar en local

Quienes prueban modelos locales suelen encontrarse con los mismos problemas. Anticípate para no bloquear la máquina ni frustrarte con el rendimiento.

✓ Hazlo

  • ✓Revisa las specs antes (envía el screenshot)
  • ✓Empieza con un modelo ligero (Gemma) y sube
  • ✓Usa el entorno local cuando la privacidad o el uso sin conexión sean prioritarios

✗ Evita

  • ✗Descargar un modelo demasiado grande y bloquear todo
  • ✗Esperar rendimiento de centro de datos en la laptop
  • ✗Insistir en lo local cuando la tarea requiere potencia

Decisión de bolsillo (ilustrativo)

privacidade inegociável / offline  -> 🔒 modelo LOCAL (Ollama)
máxima potência / hardware fraco   -> 🌐 modelo em NUVEM (API/OAuth)
não sei o que cabe                 -> mande specs ao Hermes e pergunte

📌 Resumen del módulo

✓
Modelo local — no solo Hermes; el propio modelo se ejecuta en la máquina.
✓
Trade-off — limitado por el hardware; menor rendimiento/velocidad.
✓
Dimensionar — captura de pantalla de "Acerca de esta Mac" → pregúntale a Hermes.
✓
Ollama — Gemma, Qwen 32B/3.6, Cloud gratis.
✓
Privado y sin conexión — 1000 ft bajo tierra, volando o en el espacio.

Próxima ruta:

Ruta 2 — Capacidades (memoria, soul, integraciones, MCPs)