🪟 El modelo del agente: Qwen 3 Coder 64k
El modelo que sirve para conversar no siempre sirve para actuar. Un agente necesita recordar muchas cosas al mismo tiempo, y eso requiere una ventana de contexto más grande. En este módulo vas a descargar Qwen 3 Coder y, con un archivo de tres líneas, crear una versión con 64k de contexto lista para alimentar a Hermes.
❓ Por qué el agente exige otro modelo
En el módulo 2.3 descargaste un modelo «rápido» y conversaste con él. Para conversar, es perfecto. Pero Hermes no solo quiere conversar: quiere actuar: leer archivos, ejecutar comandos, recordar lo que ya hizo y planificar los siguientes pasos. Todo eso ocupa la ventana de contexto. Por eso el agente necesita un modelo con 64k de contexto, y no del modelo predeterminado.
Recordatorio: "ventana de contexto" es la memoria de trabajo del modelo: cuánto texto puede mantener presente a la vez. Vimos esto en la Trilha 1 (módulo 1.4). 64k tokens equivalen, a grandes rasgos, a 25-30 mil palabras de espacio de trabajo.
✓ Modelo del AGENTE (64k)
- ✓Cabe todo el historial de la tarea.
- ✓Queda espacio para descripciones de herramientas.
- ✓Lee archivos grandes sin «olvidar» el comienzo.
- ✓Permite varios pasos de razonamiento.
✗ Modelo de chat predeterminado
- ✗El contexto corto se desborda rápido con las herramientas.
- ✗"Olvida" las instrucciones del inicio de la tarea.
- ✗Pierde el hilo en tareas de varios pasos.
- ✗Excelente para conversar, débil para automatizar.
Conceptos clave
El agente usa herramientas; el chat solo responde con texto.
El historial + las herramientas consumen la ventana.
El margen mínimo que el agente pide con comodidad.
Un modelo solo para el trabajo del agente.
🔎 Qué es Qwen 3 Coder
O Qwen 3 Coder es un modelo abierto de la familia Qwen, entrenado con énfasis en código y tareas de agente: leer archivos, seguir instrucciones técnicas, escribir y corregir programas. Es exactamente el tipo de modelo que un SO de IA quiere usar como base, porque la mayor parte del trabajo del agente consiste en «manipular archivos y ejecutar cosas».
📊 Por qué es la base del agente
- •Open weights: descarga una vez, se ejecuta localmente, sin mensualidad.
- •Entrenamiento para código: bueno para leer, escribir y editar archivos.
- •Tamaño 30B: se ejecuta en máquinas con mucha RAM (ver módulo 2.2).
- •Base flexible: puedes derivar una versión con más contexto, y eso es lo que haremos.
¿Nuevo por aquí? "Coder" en el nombre no significa que solo sirva para programar: significa que fue entrenado para este tipo de tareas estructuradas. Como el trabajo de un agente se parece mucho a programar (pasos, herramientas, archivos), este perfil le queda como anillo al dedo.
Conceptos clave
Modelo abierto enfocado en código y agentes.
Los pesos son públicos; tú lo ejecutas localmente.
Variante de ~30 mil millones de parámetros.
A partir de él creamos una versión 64k.
🧩 El truco de num_ctx (el Modelfile)
Aquí está la clave: tú no hace falta de otra descarga para tener más contexto. Tomas el modelo que ya existe y creas una "receta" que le dice a Ollama: usa este modelo, pero con la ventana abierta en 64k. Esta receta es un archivo llamado Modelfile.
¿Nuevo por aquí? Un Modelfile es un archivo de texto con instrucciones para que Ollama construya un modelo. Piensa en una receta: la línea FROM dice cuál es el modelo base; PARAMETER ajusta un comportamiento. Aquí solo modificamos el num_ctx (número de tokens de contexto).
🎯 Objetivo
Crear un archivo de texto llamado Modelfile (sin extensión) en una carpeta que elijas, con exactamente estas dos líneas. La primera señala el modelo base; la segunda abre la ventana a 65536 tokens (= 64k).
Contenido del archivo Modelfile:
FROM qwen3-coder:30b
PARAMETER num_ctx 65536
Cómo verificar: el archivo debe tener solo estas 2 líneas, en texto sin formato. Compruébalo con cat Modelfile (Mac/Linux) o abriéndolo en el bloc de notas. 65536 = 64 × 1024; es el número que muestra el video (context_length: 65536).
Variable: <qwen3-coder:30b> y es el modelo base: cámbialo solo si usas otra etiqueta/modelo. Todo lo demás queda igual.
Conceptos clave
La receta de texto que define un modelo derivado.
Indica el modelo base (aquí, qwen3-coder:30b).
Define el tamaño de la ventana de contexto.
64k en tokens (64 × 1024).
🏗️ Crear el modelo derivado
Con el Modelfile guardado, un solo comando crea el nuevo modelo. Ollama lee la receta, reutiliza los pesos que ya están en tu disco (no los vuelve a descargar) y registra un modelo nuevo llamado qwen3-coder-64k.
🎯 Objetivo
Ejecuta este comando en la misma carpeta dónde está el archivo Modelfile. El -f Modelfile dice qué receta usar; qwen3-coder-64k y es el nombre que tendrá tu nuevo modelo.
ollama create qwen3-coder-64k -f Modelfile
Cómo verificar: la terminal muestra líneas de progreso y termina con success. Es rápido: no vuelve a descargar el modelo, solo crea la nueva configuración a partir de lo que ya existe.
Variable: el nombre qwen3-coder-64k y elige el tuyo: usa cualquier etiqueta que te ayude a recordar «este es el del agente, con 64k».
Conceptos clave
Crea un modelo a partir de un Modelfile.
Indica el archivo de receta que se usará.
No lo vuelve a descargar; aprovecha el modelo que está en el disco.
El nombre del nuevo modelo derivado.
✅ Verificar que funcionó
Antes de conectarlo a Hermes, conviene comprobar que el modelo existe y que realmente tiene 64k. Dos comandos bastan: uno lista los modelos y el otro muestra los detalles, incluido el context length.
🎯 Objetivo
Confirmar que qwen3-coder-64k aparece en la lista e inspeccionar su contexto.
ollama list
ollama show qwen3-coder-64k
Cómo verificar: en ollama list el nombre qwen3-coder-64k debe aparecer en la tabla. En ollama show busca context_length: 65536 (o el parámetro num_ctx 65536). Si ves 65536, está listo.
La receta (Modelfile) toma el modelo base y abre la ventana a 64k, produciendo el qwen3-coder-64k. Fíjate: no hay ninguna descarga nueva; la mejora del contexto es una configuración, no una reinstalación.
Conceptos clave
Tabla de los modelos instalados.
Detalles de un modelo, incluido el contexto.
Debe mostrar 65536 = 64k confirmado.
Probar los 64k antes de conectarse a Hermes.
⚖️ 64k cuesta memoria
No hay almuerzo gratis: abrir la ventana a 64k consume más RAM. Cuanto mayor sea el contexto, más memoria reserva Ollama para guardar todo lo que el modelo está "leyendo" al mismo tiempo. Por eso la regla del headroom (módulo 2.2) vuelve a aplicarse aquí.
⚠️ El error que debes evitar
Forzar 64k en una máquina con poca RAM puede hacer que el modelo vaya lento o que el sistema use el disco como memoria (swap). Si se traba, reduce el num_ctx (p. ej., 32768) o usa un modelo base más pequeño. El contexto da potencia, pero los pesos también.
💡 Consejo práctico
Deja margen: el agente necesita tener el modelo cargado Y el contexto completo al mismo tiempo. Si tu máquina tiene pocos recursos, primero prueba con el modelo predeterminado y aumenta el num_ctx poco a poco. Descargar, probar y borrar sigue siendo barato.
Conceptos clave
Ventana más grande = más memoria reservada.
Deja RAM libre para cuando el contexto esté lleno.
Sin RAM, el sistema usa el disco y se vuelve lento.
Reduce a 32768 si falta memoria.
Autocomprobación (opcional): ¿por qué creamos qwen3-coder-64k en vez de usar el modelo de chat predeterminado?
🎯 Resumen del módulo
Siguiente módulo:
2.5 — Conectar el modelo local al Agente Hermes