PTENES
MÓDULO 2.2

🎚️ Elegir el modelo adecuado para tu hardware

Antes de dedicar tiempo (y espacio en disco) a descargar 18 GB, vale la pena parar 5 minutos para averiguar qué soporta tu máquina. En este módulo vas a consultar el hardware, pedirle una recomendación a Hermes, entender los niveles de esfuerzo y aplicar la regla de oro de headroom: nunca llenar la RAM hasta el tope.

6
Temas
~30
Minutos
Básico
Nivel
Práctico
Tipo
1

🖥️ Conoce tu hardware

Todo comienza con un número: cuánta memoria (RAM) tienes. Es la RAM, más que el chip, la que determina qué modelo cabe en tu equipo. En Mac, solo tienes que abrir el menú Apple → «Acerca de esta Mac» y leer la línea de memoria y el chip. En Windows, el atajo de teclado es Ctrl+Shift+Esc → pestaña «Rendimiento» → «Memoria».

Ventana «Acerca de esta Mac» que muestra el chip Apple y 36 GB de memoria
La ventana «Acerca de esta Mac»: fíjate en los dos números que importan: el chip (aquí, un Apple M) y la memoria (36 GB). Esos 36 GB son el límite de lo que puedes cargar; de ahí sacarás el margen del headroom.

¿Nuevo por aquí? "RAM" es la memoria de trabajo de la computadora, donde el modelo necesita caber completo para funcionar rápido. En las Mac con chip Apple, la memoria es "unificada", es decir, compartida entre CPU y GPU; por eso cuenta ese único número (p. ej., 36 GB).

Conceptos clave

RAM

Memoria de trabajo; es la que define qué modelo cabe.

Chip / GPU

Influye en la velocidad; en las Mac con chip M, la memoria es unificada.

Acerca de esta Mac

Dónde consultar el chip y la memoria en segundos.

Límite de memoria

El modelo + el contexto deben caber en ese número.

2

🤝 Pide una recomendación

No necesitas memorizar ninguna tabla. El atajo es mostrarle tu hardware al propio Hermes (basta con una captura de «Acerca de esta Mac») y preguntar: «¿Qué modelos funcionan bien aquí?». El modelo compara tu RAM con el tamaño de los modelos y te devuelve una lista lista para usar.

Chat de Hermes recomendando modelos Qwen para un Mac M4 Max de 36 GB
Hermes lee «M4 Max, 36 GB» y responde con opciones que caben. Fíjate en que enumera varios tamaños — ese es el punto: obtienes un menú de candidatos, no una única respuesta. Desde aquí eliges según el margen disponible.

📊 Ejemplo real: M4 Max 36 GB

Para un equipo con 36 GB, Hermes suele sugerir opciones como estas, todas modelos abiertos:

Qwen3 32B

Más capaz, pesa más.

Qwen3 30B-A3B

Rápido y equilibrado (el del video).

Mistral Small 24B

Ligero, deja RAM libre.

Gemma 3 27B

Punto medio de la lista.

💡 Consejo práctico

¿No tienes Hermes a mano? La regla general: un modelo cuantizado en q4 ocupa, en GB, más o menos el número de miles de millones de parámetros multiplicado por ~0,6. Un "30B" ronda los 18 GB; por eso cabe (con margen) en una máquina de 36 GB.

Conceptos clave

Recomendación según el hardware

Mostrar el "Acerca de" y dejar que el agente sugiera.

Menú de candidatos

Varios tamaños; tú eliges según el margen disponible.

Familias abiertas

Qwen, Mistral, Gemma: todos con pesos abiertos.

Estimación por B

~0,6 GB por mil millones en q4 — cálculo aproximado.

3

🎚️ Niveles de esfuerzo

Elegir el modelo es solo la mitad de la historia. El selector de Hermes también te permite ajustar cuánto esfuerzo pone en cada respuesta: de Minimal a Max — además de dos toggles: Thinking (pensar más antes de responder) y Fast (priorizar la velocidad).

Selector de modelo de Hermes con niveles de esfuerzo de Minimal a Max, interruptores Thinking y Fast, y la lista de modelos
El selector de Hermes: la escala de esfuerzo (Minimal → Max) controla la profundidad del razonamiento, y los toggles Thinking/Fast cambian calidad por velocidad. Todo esto sin tener que descargar otro modelo — ajustas el mismo.
↓

Minimal / Low / Fast

Respuestas rápidas, consume menos. Bueno para tareas simples y para que la máquina no se caliente.

=

Medium

El equilibrio del día a día — buena calidad sin tardar demasiado.

↑

High / Max / Thinking

Máximo nivel de razonamiento para problemas difíciles. Tarda más y exige más a la máquina.

¿Nuevo por aquí? "Effort" (esfuerzo) no cambia el modelo: cambia cuánto "se esfuerza" antes de responder. "Thinking" es el modo en que el modelo razona paso a paso (ese "Thought for X seconds" que ves después). "Fast" es lo opuesto: reduce el razonamiento para responder de inmediato.

Conceptos clave

Effort (esfuerzo)

Minimal → Max, la profundidad de la respuesta.

Thinking

Piensa más antes de responder.

Fast

Prioriza la velocidad sobre la profundidad.

Mismo modelo

Ajústalo sin tener que descargar otro.

4

⚖️ La regla del margen de seguridad

Esta es la regla de oro de este módulo: deja margen de RAM. El modelo debe caber en la memoria y dejar espacio para el sistema operativo, el navegador y lo demás. Llenar la RAM al máximo hace que la máquina use el disco como memoria de intercambio y todo se vuelve lento, incluido el modelo.

CABE DE SOBRA · 36 GB modelo de ~18 GB margen sistema ✓ SE AGOTA · sin margen modelo demasiado grande RAM llena → swap → lento

A la izquierda, un modelo de ~18 GB en una máquina de 36 GB te deja margen para el sistema: todo vuela. A la derecha, un modelo demasiado grande llena la RAM, fuerza el uso del disco (swap) y todo se vuelve lento. Por eso: procura que sobre memoria.

✓ Cabe con margen

  • ✓El modelo + el contexto ocupan mucho menos que la RAM total.
  • ✓Queda memoria para el sistema y las apps abiertas.
  • ✓Respuestas rápidas, máquina ágil.
  • ✓Puedes ampliar el contexto (p. ej., 64k) sin que se bloquee.

✗ Se agota la memoria

  • ✗El modelo casi llena toda la RAM disponible.
  • ✗El sistema empieza a usar el disco (swap) como memoria.
  • ✗Las respuestas son lentas y toda la máquina se traba.
  • ✗Puede que simplemente no haya espacio para cargar el contexto.

El método correcto y económico: descargar → probar → eliminar. Como el uso es gratuito, prueba un modelo, comprueba si tu equipo puede manejarlo con holgura y, si no te gusta, bórralo. Explorar no cuesta nada: solo el tiempo de descarga.

⌨️ Copy-run: ver y borrar modelos

Objetivo: enumerar lo que ya descargaste y eliminar un modelo que no funcionó, liberando espacio en disco y RAM.

# 1) ver tudo que esta no disco
ollama list

# 2) apagar um modelo que voce nao vai usar
ollama rm <modelo>
# ex.: ollama rm gemma3:27b

Cómo verificar: ejecuta ollama list de nuevo: el modelo eliminado desaparece de la lista. Cambia <modelo> por el nombre exacto que aparece en ollama list.

Conceptos clave

Headroom

RAM disponible para que el sistema respire.

Swap

Usar el disco como memoria — eso hace que todo vaya lento.

Descargar→probar→borrar

El ciclo económico para explorar modelos.

ollama rm

Elimina un modelo y recupera espacio en disco.

5

🏃 Rápido vs. capaz: qué es q4_K_M

Verás nombres como qwen3:30b-a3b-q4_K_M y preguntarte qué es ese sufijo. El q4_K_M indica que el modelo fue cuantizado: comprimido para ocupar menos memoria, cambiando un poquito de precisión por mucho menos peso.

¿Nuevo por aquí? "Cuantizar" es guardar los números internos del modelo con menos decimales: en lugar de 16 bits por valor, usa 4 bits (el "q4"). El modelo se reduce bastante y, en la práctica, la calidad casi no disminuye. "K_M" es solo la variante del método de compresión (un buen equilibrio predeterminado).

📏 Leer el nombre de un modelo

  • •qwen3 — la familia (Qwen, versión 3).
  • •30b — 30 mil millones de parámetros (el tamaño del "cerebro").
  • •a3b — variante «activa de 3B» (mezcla de especialistas: funciona rápido).
  • •q4_K_M — cuantizado a 4 bits: más pequeño y ligero.

💡 Consejo práctico

Entre dos versiones del mismo modelo, la cuantizada (q4) casi siempre es la opción correcta para uso local: puedes usar un modelo más grande con la misma RAM y la diferencia de calidad es pequeña. Las versiones «fp16» (sin cuantizar) solo valen la pena si realmente te sobra memoria.

Conceptos clave

Cuantización

Comprimir el modelo para que ocupe menos RAM.

q4_K_M

4 bits, variante equilibrada — el estándar local.

Parámetros (B)

El «30B» = 30 mil millones; el tamaño del cerebro.

Tamaño vs. precisión

Pequeña pérdida de calidad a cambio de mucho menos consumo.

6

🎯 Cuál descargar primero

Para no quedarte atascado eligiendo, aquí tienes una recomendación concreta: empieza con el qwen3:30b-a3b-q4_K_M. Es el «modelo rápido» del video: equilibrado, cuantizado, con la variante a3b que lo hace veloz y que cabe holgadamente en equipos de ~32 GB o más. Puedes cambiarlo después; lo importante es tener un primer modelo funcionando.

🧩 El plan en una frase

Lee tu RAM → pide la recomendación → elige un modelo que quepa con holgura → descarga el qwen3:30b-a3b-q4_K_M como primer paso. En el módulo 2.3 lo descargas y conversas con él de verdad.

El modelo del agente (con 64k de contexto) viene en el módulo 2.4; este requiere una preparación extra.

Atajo sincero: no existe «el mejor modelo» universal. El mejor es el que cabe holgadamente en TU máquina y responde lo suficientemente rápido para que no te des por vencido. Empieza por el recomendado y ajústalo con el tiempo.

Conceptos clave

Primer modelo

qwen3:30b-a3b-q4_K_M — equilibrado y rápido.

Cabe de sobra

~18 GB en una máquina de ~32 GB+.

Intercambiable

Empieza con algo sencillo y ajusta después.

El modelo del agente viene después

Los 64k son del módulo 2.4.

Autocomprobación (opcional): ¿cuál es la mejor elección de modelo para tu máquina?

🎯 Resumen del módulo

✓
Lee tu hardware — la RAM es el número que determina qué modelo cabe.
✓
Pide una recomendación — muéstrale la sección "Acerca de" a Hermes y obtén un menú de candidatos.
✓
Headroom y q4_K_M — deja margen de RAM y prefiere el modelo cuantizado.
✓
Empieza por la opción recomendada — qwen3:30b-a3b-q4_K_M; cámbialo después con criterio.

Siguiente módulo:

2.3 — Descargar y conversar con tu primer modelo