PTENES
MÓDULO 2.4

🪟 El modelo del agente: Qwen 3 Coder 64k

El modelo que sirve para conversar no siempre sirve para actuar. Un agente necesita recordar muchas cosas al mismo tiempo, y eso requiere una ventana de contexto más grande. En este módulo vas a descargar Qwen 3 Coder y, con un archivo de tres líneas, crear una versión con 64k de contexto lista para alimentar a Hermes.

6
Temas
~25
Minutos
Práctico
Nivel
Hands-on
Tipo
1

❓ Por qué el agente exige otro modelo

En el módulo 2.3 descargaste un modelo «rápido» y conversaste con él. Para conversar, es perfecto. Pero Hermes no solo quiere conversar: quiere actuar: leer archivos, ejecutar comandos, recordar lo que ya hizo y planificar los siguientes pasos. Todo eso ocupa la ventana de contexto. Por eso el agente necesita un modelo con 64k de contexto, y no del modelo predeterminado.

Recordatorio: "ventana de contexto" es la memoria de trabajo del modelo: cuánto texto puede mantener presente a la vez. Vimos esto en la Trilha 1 (módulo 1.4). 64k tokens equivalen, a grandes rasgos, a 25-30 mil palabras de espacio de trabajo.

✓ Modelo del AGENTE (64k)

  • ✓Cabe todo el historial de la tarea.
  • ✓Queda espacio para descripciones de herramientas.
  • ✓Lee archivos grandes sin «olvidar» el comienzo.
  • ✓Permite varios pasos de razonamiento.

✗ Modelo de chat predeterminado

  • ✗El contexto corto se desborda rápido con las herramientas.
  • ✗"Olvida" las instrucciones del inicio de la tarea.
  • ✗Pierde el hilo en tareas de varios pasos.
  • ✗Excelente para conversar, débil para automatizar.

Conceptos clave

Actuar vs. conversar

El agente usa herramientas; el chat solo responde con texto.

Contexto ocupado

El historial + las herramientas consumen la ventana.

64k tokens

El margen mínimo que el agente pide con comodidad.

Modelo dedicado

Un modelo solo para el trabajo del agente.

2

🔎 Qué es Qwen 3 Coder

O Qwen 3 Coder es un modelo abierto de la familia Qwen, entrenado con énfasis en código y tareas de agente: leer archivos, seguir instrucciones técnicas, escribir y corregir programas. Es exactamente el tipo de modelo que un SO de IA quiere usar como base, porque la mayor parte del trabajo del agente consiste en «manipular archivos y ejecutar cosas».

📊 Por qué es la base del agente

  • •Open weights: descarga una vez, se ejecuta localmente, sin mensualidad.
  • •Entrenamiento para código: bueno para leer, escribir y editar archivos.
  • •Tamaño 30B: se ejecuta en máquinas con mucha RAM (ver módulo 2.2).
  • •Base flexible: puedes derivar una versión con más contexto, y eso es lo que haremos.

¿Nuevo por aquí? "Coder" en el nombre no significa que solo sirva para programar: significa que fue entrenado para este tipo de tareas estructuradas. Como el trabajo de un agente se parece mucho a programar (pasos, herramientas, archivos), este perfil le queda como anillo al dedo.

Conceptos clave

Qwen 3 Coder

Modelo abierto enfocado en código y agentes.

Open weights

Los pesos son públicos; tú lo ejecutas localmente.

Etiqueta 30b

Variante de ~30 mil millones de parámetros.

Modelo base

A partir de él creamos una versión 64k.

3

🧩 El truco de num_ctx (el Modelfile)

Aquí está la clave: tú no hace falta de otra descarga para tener más contexto. Tomas el modelo que ya existe y creas una "receta" que le dice a Ollama: usa este modelo, pero con la ventana abierta en 64k. Esta receta es un archivo llamado Modelfile.

¿Nuevo por aquí? Un Modelfile es un archivo de texto con instrucciones para que Ollama construya un modelo. Piensa en una receta: la línea FROM dice cuál es el modelo base; PARAMETER ajusta un comportamiento. Aquí solo modificamos el num_ctx (número de tokens de contexto).

🎯 Objetivo

Crear un archivo de texto llamado Modelfile (sin extensión) en una carpeta que elijas, con exactamente estas dos líneas. La primera señala el modelo base; la segunda abre la ventana a 65536 tokens (= 64k).

Contenido del archivo Modelfile:

FROM qwen3-coder:30b
PARAMETER num_ctx 65536

Cómo verificar: el archivo debe tener solo estas 2 líneas, en texto sin formato. Compruébalo con cat Modelfile (Mac/Linux) o abriéndolo en el bloc de notas. 65536 = 64 × 1024; es el número que muestra el video (context_length: 65536).

Variable: <qwen3-coder:30b> y es el modelo base: cámbialo solo si usas otra etiqueta/modelo. Todo lo demás queda igual.

Conceptos clave

Modelfile

La receta de texto que define un modelo derivado.

FROM

Indica el modelo base (aquí, qwen3-coder:30b).

PARAMETER num_ctx

Define el tamaño de la ventana de contexto.

65536

64k en tokens (64 × 1024).

4

🏗️ Crear el modelo derivado

Con el Modelfile guardado, un solo comando crea el nuevo modelo. Ollama lee la receta, reutiliza los pesos que ya están en tu disco (no los vuelve a descargar) y registra un modelo nuevo llamado qwen3-coder-64k.

🎯 Objetivo

Ejecuta este comando en la misma carpeta dónde está el archivo Modelfile. El -f Modelfile dice qué receta usar; qwen3-coder-64k y es el nombre que tendrá tu nuevo modelo.

ollama create qwen3-coder-64k -f Modelfile

Cómo verificar: la terminal muestra líneas de progreso y termina con success. Es rápido: no vuelve a descargar el modelo, solo crea la nueva configuración a partir de lo que ya existe.

Variable: el nombre qwen3-coder-64k y elige el tuyo: usa cualquier etiqueta que te ayude a recordar «este es el del agente, con 64k».

Pantalla del video que muestra el Modelfile con PARAMETER num_ctx 65536 y la conversación sobre el modelo qwen3-coder-64k de 64k de contexto
Fotograma del video: fíjate en el PARAMETER num_ctx 65536 y en el nombre del modelo derivado (qwen3-coder-64k). El agente usará esta versión, no el modelo predeterminado, porque tiene abierta la ventana de 64k.

Conceptos clave

ollama create

Crea un modelo a partir de un Modelfile.

-f Modelfile

Indica el archivo de receta que se usará.

Reutilización de pesos

No lo vuelve a descargar; aprovecha el modelo que está en el disco.

qwen3-coder-64k

El nombre del nuevo modelo derivado.

5

✅ Verificar que funcionó

Antes de conectarlo a Hermes, conviene comprobar que el modelo existe y que realmente tiene 64k. Dos comandos bastan: uno lista los modelos y el otro muestra los detalles, incluido el context length.

🎯 Objetivo

Confirmar que qwen3-coder-64k aparece en la lista e inspeccionar su contexto.

ollama list
ollama show qwen3-coder-64k

Cómo verificar: en ollama list el nombre qwen3-coder-64k debe aparecer en la tabla. En ollama show busca context_length: 65536 (o el parámetro num_ctx 65536). Si ves 65536, está listo.

qwen3-coder:30b modelo base contexto predeterminado Modelfile FROM qwen3-coder:30b num_ctx 65536 qwen3-coder-64k ventana de 64k abierta listo para el agente ✓ el modelo base no se vuelve a descargar; solo obtiene una ventana más grande

La receta (Modelfile) toma el modelo base y abre la ventana a 64k, produciendo el qwen3-coder-64k. Fíjate: no hay ninguna descarga nueva; la mejora del contexto es una configuración, no una reinstalación.

Conceptos clave

ollama list

Tabla de los modelos instalados.

ollama show

Detalles de un modelo, incluido el contexto.

context_length

Debe mostrar 65536 = 64k confirmado.

Verificar antes

Probar los 64k antes de conectarse a Hermes.

6

⚖️ 64k cuesta memoria

No hay almuerzo gratis: abrir la ventana a 64k consume más RAM. Cuanto mayor sea el contexto, más memoria reserva Ollama para guardar todo lo que el modelo está "leyendo" al mismo tiempo. Por eso la regla del headroom (módulo 2.2) vuelve a aplicarse aquí.

⚠️ El error que debes evitar

Forzar 64k en una máquina con poca RAM puede hacer que el modelo vaya lento o que el sistema use el disco como memoria (swap). Si se traba, reduce el num_ctx (p. ej., 32768) o usa un modelo base más pequeño. El contexto da potencia, pero los pesos también.

💡 Consejo práctico

Deja margen: el agente necesita tener el modelo cargado Y el contexto completo al mismo tiempo. Si tu máquina tiene pocos recursos, primero prueba con el modelo predeterminado y aumenta el num_ctx poco a poco. Descargar, probar y borrar sigue siendo barato.

Conceptos clave

El contexto ocupa RAM

Ventana más grande = más memoria reservada.

Headroom

Deja RAM libre para cuando el contexto esté lleno.

Swap = lento

Sin RAM, el sistema usa el disco y se vuelve lento.

Ajusta el num_ctx

Reduce a 32768 si falta memoria.

Autocomprobación (opcional): ¿por qué creamos qwen3-coder-64k en vez de usar el modelo de chat predeterminado?

🎯 Resumen del módulo

✓
El agente pide 64k — el historial + las herramientas ocupan la ventana; el modelo de chat es demasiado corto.
✓
Qwen 3 Coder es la base — modelo abierto enfocado en código/agentes, excelente como base para Hermes.
✓
Modelfile de 2 líneas — FROM + PARAMETER num_ctx 65536, después ollama create qwen3-coder-64k -f Modelfile.
✓
Comprobar y evaluar — ollama show muestra 65536; recuerda que 64k consume más RAM.

Siguiente módulo:

2.5 — Conectar el modelo local al Agente Hermes