Gestión de la ventana de contexto
Cómo optimizar el uso del contexto disponible
La ventana de contexto es el límite de tokens que un modelo puede procesar en una sola interacción. Gestionar este recurso de manera eficiente es crucial para obtener respuestas precisas y relevantes, especialmente en aplicaciones complejas.
Límites de contexto por modelo
Estrategias de optimización
Resume conversaciones anteriores conservando la información esencial
Incluye solo el contexto relevante para la tarea actual
Mantén los N mensajes más recientes y descarta los antiguos
Usa bases de datos vectoriales para almacenar y recuperar contexto
Introducción al RAG
Generación aumentada por recuperación
RAG (Retrieval-Augmented Generation) es una arquitectura que combina la capacidad generativa de los LLM con la búsqueda en bases de conocimiento externas. Esto permite que el modelo responda con base en información actualizada y específica de tu dominio.
Pipeline RAG
Ventajas
- • Conocimiento actualizado
- • Reduce las alucinaciones
- • Citas verificables
- • Dominio específico
Desafíos
- • Calidad de la recuperación
- • Latencia adicional
- • Mantenimiento de la base
- • Costo de embeddings
Embeddings y búsqueda vectorial
Representación semántica de texto
Los embeddings son representaciones numéricas (vectores) de texto que capturan su significado semántico. Los textos con significados similares tendrán vectores cercanos en el espacio vectorial, lo que permite hacer búsquedas por similitud.
Cómo funciona
# Texto original
"El gato durmió en el sofá"
↓ Modelo de embeddings
# Vector (simplificado)
[0.23, -0.45, 0.67, 0.12, -0.89, ...]
* Los vectores reales tienen 768-3072 dimensiones
Modelos de embeddings populares
Pinecone
DB vectorial administrada
Weaviate
Open source
Chroma
Ligero y sencillo
Estrategias de chunking
División inteligente de documentos
La fragmentación es el proceso de dividir documentos grandes en segmentos más pequeños para indexarlos. La estrategia de fragmentación impacta directamente en la calidad de la recuperación en RAG.
Estrategias de chunking
📏 Por Tamaño Fijo
Divide en chunks de N tokens con overlap
📝 Por estructura
Respeta la estructura del documento (párrafos, secciones, markdown)
🧠 Semántico
Usa embeddings para identificar cambios de tema
🔄 Recursivo
Prueba primero con separadores más grandes y luego con los más pequeños
Consejo de oro
No existe un tamaño de chunk perfecto. Prueba valores entre 256-1024 tokens y evalúa empíricamente cuál funciona mejor para tu caso de uso específico.
Evaluación de prompts
Métricas y metodologías de prueba
Evaluar la calidad de los prompts y sistemas de IA es esencial para la mejora continua. Una buena metodología de evaluación combina métricas automáticas con revisión humana.
Framework de evaluación
📊 Métricas automáticas
- Relevancia: Cosine similarity con gold standard
- Precisión: % de respuestas correctas
- Recall: % de información recuperada
- Latencia: Tiempo de respuesta
👥 Evaluación humana
- Utilidad: ¿La respuesta ayuda al usuario?
- Claridad: ¿Es fácil de entender?
- Veracidad: ¿Información correcta?
- Completitud: ¿Aborda todos los puntos?
Metodología de Prueba
Crear dataset de prueba
Recopila ejemplos representativos con respuestas esperadas
Definir las métricas
Elige métricas alineadas con tus objetivos de negocio
Probar variaciones
Compara distintas versiones del prompt (pruebas A/B)
Analizar e iterar
Usa los conocimientos obtenidos para mejorar continuamente
Prompts en producción
Deploy, monitoreo y escalabilidad
Llevar sistemas de IA a producción requiere prestar atención a aspectos como el control de versiones, la supervisión, la seguridad, los costos y la escalabilidad. Un deploy bien hecho garantiza la confiabilidad y permite mejoras continuas.
Lista de verificación de producción
Control de versiones
- • Control de versiones de prompts
- • Historial de cambios
- • Reversión fácil
Monitoreo
- • Registros de solicitudes
- • Métricas de calidad
- • Alertas de anomalías
Seguridad
- • Limitación de solicitudes
- • Sanitización de entradas
- • Protección de datos
Costos
- • Seguimiento de tokens
- • Optimización de prompts
- • Caché de respuestas
Arquitectura de referencia
┌─────────────────────────────────────────┐
│ USUARIOS │
└──────────────────┬──────────────────────┘
│
▼
┌─────────────────────────────────────────┐
│ API Gateway (límite de solicitudes, autenticación) │
└──────────────────┬──────────────────────┘
│
▼
┌─────────────────────────────────────────┐
│ Servicio de prompts (plantillas, caché) │
└───────┬─────────────────────┬───────────┘
│ │
▼ ▼
┌───────────────┐ ┌───────────────────┐
│ Base de datos vectorial │ │ API de LLM │
│ (RAG) │ │ (OpenAI, etc.) │
└───────────────┘ └───────────────────┘
Proyecto final integrador
Aplicación de todos los conceptos del nivel técnico
El proyecto final es la oportunidad de demostrar dominio de las técnicas aprendidas. Construirás un sistema completo de Q&A con RAG sobre una base de conocimiento de tu elección.
Especificación del proyecto
🎯 Objetivo
Crear un asistente especializado de Q&A que responda preguntas sobre un dominio específico (documentación técnica, manual de producto, base legal, etc.)
📋 Requisitos
- • Pipeline RAG completo (ingesta, chunking, embedding, retrieval)
- • System prompt profesional con persona y guardrails
- • Formato estructurado de respuestas
- • Cita de fuentes en las respuestas
- • Tratamiento de preguntas fuera del alcance
📦 Entregables
- 1. Documentación de la arquitectura
- 2. System prompt completo y comentado
- 3. Código/configuración del pipeline RAG
- 4. Dataset de prueba con más de 20 preguntas
- 5. Informe de evaluación con métricas
Rúbrica de evaluación
🎓 ¡Felicidades!
Al completar este proyecto, habrás demostrado competencia en ingeniería de prompts a nivel técnico. Estás listo para la Nivel Masterclass!