Cómo interpretan los modelos el contexto largo
Mecanismos internos y limitaciones
Los modelos con ventanas de 100k-2M tokens no procesan todo el texto por igual. Entender los mecanismos de atención y sus sesgos es fundamental para optimizar el uso de contextos extensos.
Sesgos de atención
Sesgo de primacía
El inicio del contexto tiene más peso
Lost in Middle
El centro tiende a ser ignorado
Sesgo de recencia
El final del contexto tiene alta prioridad
Implicaciones prácticas
- → Coloca las instrucciones críticas en el inicio del contexto
- → Repite la información importante en el final (task reminder)
- → Usa marcadores explícitos para el contenido intermedio
- → Prueba la recuperación de información en diferentes posiciones
Ventanas grandes vs. RAG tradicional
Cuándo usar cada enfoque
Con 1-2M tokens disponibles, puedes cargar documentos completos en la ventana de contexto. Esto cambia fundamentalmente la necesidad de RAG, pero no la elimina.
📚 Carga Completa del Contexto
Cuándo usar:
- • El corpus cabe en la ventana (<1M tokens)
- • Requiere una visión holística
- • Referencias cruzadas entre documentos
- • La latencia de retrieval es un problema
🔍 RAG selectivo
Cuándo usar:
- • El corpus es muy grande (TB de datos)
- • Los datos cambian con frecuencia
- • El costo por token es crítico
- • Requiere precisión quirúrgica
Matriz de decisión
| Escenario | Contexto completo | RAG |
|---|---|---|
| Manual de 50 páginas | ✅ Ideal | Innecesario |
| Base de 10M documentos | Imposible | ✅ Necesario |
| Base de código de 500k líneas | ✅ Viable | ✅ Alternativa |
| Feed de noticias en tiempo real | Impracticable | ✅ Ideal |
Estrategias de organización de contexto extenso
Estructuración de 100k-1M tokens
Técnicas de organización
📑 Tabla de Contenidos
Incluye un índice al inicio que enumere las secciones y sus posiciones. El modelo lo usa como mapa de navegación.
🏷️ Encabezados de Sección
Usa delimitadores claros y consistentes: === SECCIÓN: Nombre ===
🎯 Orden por relevancia
Ordena los documentos por relevancia esperada, de más relevantes a menos relevantes.
📋 Enriquecimiento de Metadata
Agrega metadatos: [SOURCE: doc1.pdf] [DATE: 2024-01] [RELEVANCE: HIGH]
Ejemplo: estructura para analizar una base de código
=== TABLE OF CONTENTS ===
1. Architecture Overview (line 50)
2. API Endpoints (line 500)
3. Data Models (line 2000)
4. Tests (line 5000)
=== SECTION: Architecture Overview ===
[RELEVANCE: HIGH] [TYPE: documentation]
...
Resumen progresivo y compresión semántica
Preservar información con menos tokens
Incluso con ventanas grandes, a veces el contexto supera el límite. Las técnicas de compresión permiten conservar la información esencial y reducir los tokens.
Técnicas de compresión
🔄 Resumen jerárquico
Resume por niveles: documento → sección → párrafo. Carga el nivel apropiado.
🎯 Extracción de entidades
Extrae las entidades y relaciones clave; descarta el texto narrativo.
📊 Conversión Estructurada
Convierte prosa en JSON/tablas: más denso semánticamente.
🗜️ Compresión progresiva
El contenido antiguo está más comprimido. El reciente, más detallado.
Priorización y descarte de contexto
Decidir qué conservar
Criterios de priorización
Puntaje de similitud semántica con la consulta
La información más reciente suele ser más relevante
Etiquetas explícitas: [CRITICAL], [REQUIRED], [OPTIONAL]
Contexto referenciado por otros que se mantienen
Anti-Patterns en Long Context
Errores comunes y cómo evitarlos
Anti-Patterns comunes
❌ Falacia de "más es mejor"
Agregar todo el contexto disponible sin selección.
❌ Contexto plano
Sin estructura ni jerarquía: todo está al mismo nivel.
❌ Instrucciones enterradas
Poner instrucciones importantes en medio del contexto.
❌ Contexto desactualizado
Mantener un contexto desactualizado o contradictorio.