🎚️ Elegir el modelo adecuado para tu hardware
Antes de dedicar tiempo (y espacio en disco) a descargar 18 GB, vale la pena parar 5 minutos para averiguar qué soporta tu máquina. En este módulo vas a consultar el hardware, pedirle una recomendación a Hermes, entender los niveles de esfuerzo y aplicar la regla de oro de headroom: nunca llenar la RAM hasta el tope.
🖥️ Conoce tu hardware
Todo comienza con un número: cuánta memoria (RAM) tienes. Es la RAM, más que el chip, la que determina qué modelo cabe en tu equipo. En Mac, solo tienes que abrir el menú Apple → «Acerca de esta Mac» y leer la línea de memoria y el chip. En Windows, el atajo de teclado es Ctrl+Shift+Esc → pestaña «Rendimiento» → «Memoria».
¿Nuevo por aquí? "RAM" es la memoria de trabajo de la computadora, donde el modelo necesita caber completo para funcionar rápido. En las Mac con chip Apple, la memoria es "unificada", es decir, compartida entre CPU y GPU; por eso cuenta ese único número (p. ej., 36 GB).
Conceptos clave
Memoria de trabajo; es la que define qué modelo cabe.
Influye en la velocidad; en las Mac con chip M, la memoria es unificada.
Dónde consultar el chip y la memoria en segundos.
El modelo + el contexto deben caber en ese número.
🤝 Pide una recomendación
No necesitas memorizar ninguna tabla. El atajo es mostrarle tu hardware al propio Hermes (basta con una captura de «Acerca de esta Mac») y preguntar: «¿Qué modelos funcionan bien aquí?». El modelo compara tu RAM con el tamaño de los modelos y te devuelve una lista lista para usar.
📊 Ejemplo real: M4 Max 36 GB
Para un equipo con 36 GB, Hermes suele sugerir opciones como estas, todas modelos abiertos:
Más capaz, pesa más.
Rápido y equilibrado (el del video).
Ligero, deja RAM libre.
Punto medio de la lista.
💡 Consejo práctico
¿No tienes Hermes a mano? La regla general: un modelo cuantizado en q4 ocupa, en GB, más o menos el número de miles de millones de parámetros multiplicado por ~0,6. Un "30B" ronda los 18 GB; por eso cabe (con margen) en una máquina de 36 GB.
Conceptos clave
Mostrar el "Acerca de" y dejar que el agente sugiera.
Varios tamaños; tú eliges según el margen disponible.
Qwen, Mistral, Gemma: todos con pesos abiertos.
~0,6 GB por mil millones en q4 — cálculo aproximado.
🎚️ Niveles de esfuerzo
Elegir el modelo es solo la mitad de la historia. El selector de Hermes también te permite ajustar cuánto esfuerzo pone en cada respuesta: de Minimal a Max — además de dos toggles: Thinking (pensar más antes de responder) y Fast (priorizar la velocidad).
Minimal / Low / Fast
Respuestas rápidas, consume menos. Bueno para tareas simples y para que la máquina no se caliente.
Medium
El equilibrio del día a día — buena calidad sin tardar demasiado.
High / Max / Thinking
Máximo nivel de razonamiento para problemas difíciles. Tarda más y exige más a la máquina.
¿Nuevo por aquí? "Effort" (esfuerzo) no cambia el modelo: cambia cuánto "se esfuerza" antes de responder. "Thinking" es el modo en que el modelo razona paso a paso (ese "Thought for X seconds" que ves después). "Fast" es lo opuesto: reduce el razonamiento para responder de inmediato.
Conceptos clave
Minimal → Max, la profundidad de la respuesta.
Piensa más antes de responder.
Prioriza la velocidad sobre la profundidad.
Ajústalo sin tener que descargar otro.
⚖️ La regla del margen de seguridad
Esta es la regla de oro de este módulo: deja margen de RAM. El modelo debe caber en la memoria y dejar espacio para el sistema operativo, el navegador y lo demás. Llenar la RAM al máximo hace que la máquina use el disco como memoria de intercambio y todo se vuelve lento, incluido el modelo.
A la izquierda, un modelo de ~18 GB en una máquina de 36 GB te deja margen para el sistema: todo vuela. A la derecha, un modelo demasiado grande llena la RAM, fuerza el uso del disco (swap) y todo se vuelve lento. Por eso: procura que sobre memoria.
✓ Cabe con margen
- ✓El modelo + el contexto ocupan mucho menos que la RAM total.
- ✓Queda memoria para el sistema y las apps abiertas.
- ✓Respuestas rápidas, máquina ágil.
- ✓Puedes ampliar el contexto (p. ej., 64k) sin que se bloquee.
✗ Se agota la memoria
- ✗El modelo casi llena toda la RAM disponible.
- ✗El sistema empieza a usar el disco (swap) como memoria.
- ✗Las respuestas son lentas y toda la máquina se traba.
- ✗Puede que simplemente no haya espacio para cargar el contexto.
El método correcto y económico: descargar → probar → eliminar. Como el uso es gratuito, prueba un modelo, comprueba si tu equipo puede manejarlo con holgura y, si no te gusta, bórralo. Explorar no cuesta nada: solo el tiempo de descarga.
⌨️ Copy-run: ver y borrar modelos
Objetivo: enumerar lo que ya descargaste y eliminar un modelo que no funcionó, liberando espacio en disco y RAM.
# 1) ver tudo que esta no disco
ollama list
# 2) apagar um modelo que voce nao vai usar
ollama rm <modelo>
# ex.: ollama rm gemma3:27b
Cómo verificar: ejecuta ollama list de nuevo: el modelo eliminado desaparece de la lista. Cambia <modelo> por el nombre exacto que aparece en ollama list.
Conceptos clave
RAM disponible para que el sistema respire.
Usar el disco como memoria — eso hace que todo vaya lento.
El ciclo económico para explorar modelos.
Elimina un modelo y recupera espacio en disco.
🏃 Rápido vs. capaz: qué es q4_K_M
Verás nombres como qwen3:30b-a3b-q4_K_M y preguntarte qué es ese sufijo. El q4_K_M indica que el modelo fue cuantizado: comprimido para ocupar menos memoria, cambiando un poquito de precisión por mucho menos peso.
¿Nuevo por aquí? "Cuantizar" es guardar los números internos del modelo con menos decimales: en lugar de 16 bits por valor, usa 4 bits (el "q4"). El modelo se reduce bastante y, en la práctica, la calidad casi no disminuye. "K_M" es solo la variante del método de compresión (un buen equilibrio predeterminado).
📏 Leer el nombre de un modelo
- •
qwen3— la familia (Qwen, versión 3). - •
30b— 30 mil millones de parámetros (el tamaño del "cerebro"). - •
a3b— variante «activa de 3B» (mezcla de especialistas: funciona rápido). - •
q4_K_M— cuantizado a 4 bits: más pequeño y ligero.
💡 Consejo práctico
Entre dos versiones del mismo modelo, la cuantizada (q4) casi siempre es la opción correcta para uso local: puedes usar un modelo más grande con la misma RAM y la diferencia de calidad es pequeña. Las versiones «fp16» (sin cuantizar) solo valen la pena si realmente te sobra memoria.
Conceptos clave
Comprimir el modelo para que ocupe menos RAM.
4 bits, variante equilibrada — el estándar local.
El «30B» = 30 mil millones; el tamaño del cerebro.
Pequeña pérdida de calidad a cambio de mucho menos consumo.
🎯 Cuál descargar primero
Para no quedarte atascado eligiendo, aquí tienes una recomendación concreta: empieza con el qwen3:30b-a3b-q4_K_M. Es el «modelo rápido» del video: equilibrado, cuantizado, con la variante a3b que lo hace veloz y que cabe holgadamente en equipos de ~32 GB o más. Puedes cambiarlo después; lo importante es tener un primer modelo funcionando.
🧩 El plan en una frase
Lee tu RAM → pide la recomendación → elige un modelo que quepa con holgura → descarga el qwen3:30b-a3b-q4_K_M como primer paso. En el módulo 2.3 lo descargas y conversas con él de verdad.
El modelo del agente (con 64k de contexto) viene en el módulo 2.4; este requiere una preparación extra.
Atajo sincero: no existe «el mejor modelo» universal. El mejor es el que cabe holgadamente en TU máquina y responde lo suficientemente rápido para que no te des por vencido. Empieza por el recomendado y ajústalo con el tiempo.
Conceptos clave
qwen3:30b-a3b-q4_K_M — equilibrado y rápido.
~18 GB en una máquina de ~32 GB+.
Empieza con algo sencillo y ajusta después.
Los 64k son del módulo 2.4.
Autocomprobación (opcional): ¿cuál es la mejor elección de modelo para tu máquina?
🎯 Resumen del módulo
Siguiente módulo:
2.3 — Descargar y conversar con tu primer modelo