🪟 Ventana de contexto y parámetros
Al elegir un modelo, te encontrarás con DOS números: los parámetros (la «B» del módulo 1.3) y la ventana de contexto. Miden cosas diferentes y no hay que confundirlas. Este módulo distingue ambas, explica por qué el agente requiere una ventana de 64k y cómo se relaciona con la memoria de tu computadora.
🪟 Qué es la ventana de contexto
A ventana de contexto y es la memoria de trabajo del modelo: todo lo que puede «tener en mente» al mismo tiempo para generar la siguiente respuesta. Incluye tu pregunta, las instrucciones, el historial de la conversación y cualquier material que hayas pegado. Si algo no cabe en la ventana, el modelo simplemente no lo ve.
¿Nuevo por aquí? Piensa en una mesa de trabajo. Todo lo que está ENCIMA de la mesa el modelo puede verlo de una vez; lo que no cabe queda en el suelo, fuera de vista. La ventana de contexto y el tamaño de esa mesa. No lo confundas con la memoria persistente del módulo 1.2 (lo que el SO RECUERDA entre conversaciones): la ventana es solo lo que cabe AHORA, en esta respuesta.
El cuadro verde es la ventana: instrucciones, historial, pregunta y lo que pegaste comparten el mismo espacio. El modelo no ve lo que se desborda (el cuadro gris a la derecha); por eso importa el TAMAÑO de la ventana.
Conceptos clave
Memoria de trabajo: lo que cabe en la respuesta actual.
El modelo ve lo que está arriba; el resto queda fuera.
Instrucciones, historial, pregunta y material pegado.
La ventana es el «ahora»; la memoria es lo que recuerda después.
🔤 Qué es un token
La ventana no se mide en palabras ni letras, sino en tokens. Un token es el fragmento de texto que manipula el modelo (¿recuerdas el módulo 1.2? Es lo que predice cada vez). En portugués/inglés, como regla práctica: 1 token ≈ 3/4 de una palabra.
¿Nuevo por aquí? Token y es la «moneda» del texto para el modelo. Puede ser una palabra completa («casa»), un fragmento de palabra («in» + «feliz» + «mente») o incluso un signo de puntuación. Como todo se cuenta en tokens, el tamaño de la ventana también se mide en tokens.
📊 Convertir tokens en algo concreto
- •Regla práctica: 1 token ≈ 3/4 de palabra (≈ 4 caracteres).
- •1.000 tokens ≈ 750 palabras ≈ 1,5 páginas de texto.
- •64k (65.536) tokens ≈ 25.000 a 30.000 palabras — un librito.
Ese "64k" es justamente el número que vamos a buscar para el agente. Antes de explicar por qué, aquí va la intuición: una ventana de 64k es espacio para que el modelo lea decenas de páginas de una sola vez, mucho más de lo que necesita una conversación breve.
Conceptos clave
El fragmento de texto que el modelo manipula y cuenta.
La regla práctica para estimar tokens.
≈ 25-30 mil palabras; el objetivo del agente.
La ventana se mide en tokens, no en palabras.
📏 Por qué el agente necesita 64k
Para un chat sencillo, basta con una ventana pequeña. Pero un agente es otra historia. Recuerda el módulo 1.2: agente = LLM + herramientas. Cada pieza de eso OCUPA contexto, y todo debe caber en la misma ventana al mismo tiempo.
Instrucciones del sistema
Cómo debe actuar el agente, sus reglas y personalidades: eso permanece en la ventana todo el tiempo.
Descripción de las herramientas
Cada herramienta (buscar, ejecutar, editar) tiene instrucciones que también ocupan tokens.
Resultados de las herramientas
Lo que devuelve cada herramienta (el contenido de un archivo, una búsqueda) vuelve a la ventana.
Historial de los pasos
El agente encadena varios pasos; necesita recordar lo que ya hizo, y eso se acumula.
🧠 Ventana pequeña = agente «amnésico»
Si la ventana es corta, el agente olvida los primeros pasos a mitad del proceso, pierde el contexto de las herramientas y se bloquea con tareas de varias etapas. Por eso el curso usa 64k: es el espacio que le da margen al agente para trabajar de verdad, sin olvidar dónde estaba.
Conceptos clave
Las instrucciones + las herramientas + el historial comparten el espacio.
Las descripciones y los resultados ocupan contexto.
Espacio para que el agente no olvide los pasos.
Poco contexto = agente perdido en tareas largas.
🔢 Parámetros vs. contexto: dos números diferentes
Esta es la confusión más común entre principiantes y el corazón de este módulo: parámetros e ventana de contexto son números independientes. Uno no depende del otro. Tienes que aprender a leer los DOS al mirar un modelo.
🔢 Parámetros (la "B")
- •Mide el TAMAÑO del cerebro (cuánto «sabe»).
- •Fijo en el modelo: 32B siempre es 32B.
- •Define la capacidad y el peso en la memoria.
🪟 Ventana de contexto
- •Mide CUÁNTO lee de una vez (la «mesa»).
- •Se puede ajustar (vamos a ampliarla a 64k en la T2).
- •Define cuánta información cabe en el «ahora».
Analogía: imagina a una persona leyendo. Los parámetros son la inteligencia y el repertorio de conocimientos (lo que ya sabe); la ventana de contexto y cuántas páginas puede mantener abiertas enfrente al mismo tiempo. Una persona muy inteligente con pocas páginas abiertas pierde el hilo; otra con la mesa llena pero poco repertorio lee todo y entiende poco. El agente necesita un buen repertorio Y una mesa grande.
Conceptos clave
Los dos números son independientes entre sí.
Cuánto «sabe» el modelo; es fijo.
Cuánto lee de una vez; se puede ajustar.
Al elegir, fíjate en la «B» Y en la ventana.
⚖️ Tamaño del modelo vs. RAM (necesitas margen)
Todo esto depende de tu hardware. Para que un modelo funcione, tiene que caber en la memoria — y no basta con que quepa justo: debe quedar margen. Tanto los parámetros como la ventana de contexto consumen RAM, y ambos se suman.
¿Nuevo por aquí? RAM (memoria de trabajo de la computadora) y es donde queda el modelo mientras se ejecuta. En las Mac con chip Apple, es «unificada» y se comparte con el resto del sistema. Regla sencilla: el modelo + la ventana de contexto + lo que ya usa el sistema deben caber en tu RAM, con margen; si no, se bloquea o funciona muy lento.
✓ Con margen de RAM
- ✓El modelo carga y responde con fluidez.
- ✓Queda espacio para el sistema y otras apps.
- ✓Puedes abrir una ventana de contexto más grande.
✗ Sin margen (al límite)
- ✗El modelo se bloquea o ni siquiera carga.
- ✗Se vuelve lentísimo (el sistema pasa al disco).
- ✗El contexto grande lo empeora todo, porque también ocupa más.
📊 El contexto también pesa
Cuidado: ampliar la ventana a 64k no es gratis. Cuanto mayor sea el contexto, más RAM reserva mientras se ejecuta. Por eso la opción práctica (en la Trilha 2) siempre es un equilibrio: parámetros que caben + la ventana que realmente necesitas, dejando margen para el sistema.
Conceptos clave
Memoria de trabajo donde se ejecuta el modelo.
Que quepa justo no basta; dejar espacio evita que se bloquee.
Una ventana más grande consume más RAM mientras está en funcionamiento.
Los dos se suman al consumo de memoria.
🎯 Elegir el contexto para cada tarea
La conclusión práctica: no necesitas UN solo modelo. Puedes tener un modelo rápido de ventana modesta para las conversaciones del día a día, y un modelo del agente con una ventana de 64k para cuando el trabajo exige memoria extensa y herramientas. Cada tarea requiere un ajuste del contexto.
🏃 Modelo rápido (chat)
- •Una ventana más pequeña basta: preguntas breves, respuestas directas.
- •Ligero para la RAM, responde rápido.
- •Ideal para el uso casual de la Ruta 2.
🤖 Modelo del agente (64k)
- •Ventana grande: instrucciones + herramientas + historial.
- •Pesa más, pero soporta tareas de varias etapas.
- •Y es lo que vamos a preparar en el módulo 2.4.
Adelanto de la Trilha 2: en el módulo 2.4 vas a crear exactamente este "modelo del agente": tomarás un modelo de código y le indicarás que use 64k de contexto mediante un pequeño archivo de configuración (Modelfile). Por ahora, basta con entender el PORQUÉ: el agente necesita una mesa grande.
Conceptos clave
Ajusta la ventana a lo que exige la tarea.
Ventana modesta para el día a día, ligera y veloz.
Ventana de 64k para tareas largas con herramientas.
Puedes tener varios y usar el adecuado para cada tarea.
Autocomprobación (opcional): ¿qué afirmación sobre los parámetros y la ventana de contexto es correcta?
🎯 Resumen del módulo
Siguiente módulo:
1.5 — El equilibrio entre privacidad, rendimiento y precio