PTENES
Ir al contenido
MÓDULO 6 NIVEL TÉCNICO

Contexto, RAG y Producción

Domina técnicas avanzadas de gestión del contexto, implementa sistemas RAG eficientes y prepara tus soluciones para la producción empresarial.

7
Temas
120
Minutos
10
Ejercicios
1

Gestión de la ventana de contexto

Cómo optimizar el uso del contexto disponible

La ventana de contexto es el límite de tokens que un modelo puede procesar en una sola interacción. Gestionar este recurso de manera eficiente es crucial para obtener respuestas precisas y relevantes, especialmente en aplicaciones complejas.

Límites de contexto por modelo

4K
GPT-3.5 Base
128K
GPT-4 Turbo
200K
Claude 3
1M+
Gemini 1.5

Estrategias de optimización

1
Compresión del historial

Resume conversaciones anteriores conservando la información esencial

2
Selección inteligente

Incluye solo el contexto relevante para la tarea actual

3
Ventanas deslizantes

Mantén los N mensajes más recientes y descarta los antiguos

4
Memoria Externa

Usa bases de datos vectoriales para almacenar y recuperar contexto

2

Introducción al RAG

Generación aumentada por recuperación

RAG (Retrieval-Augmented Generation) es una arquitectura que combina la capacidad generativa de los LLM con la búsqueda en bases de conocimiento externas. Esto permite que el modelo responda con base en información actualizada y específica de tu dominio.

Pipeline RAG

Query Pregunta del usuario
Recuperar Búsqueda semántica
Augment Agrega contexto
Generate El LLM responde

Ventajas

  • • Conocimiento actualizado
  • • Reduce las alucinaciones
  • • Citas verificables
  • • Dominio específico

Desafíos

  • • Calidad de la recuperación
  • • Latencia adicional
  • • Mantenimiento de la base
  • • Costo de embeddings
3

Embeddings y búsqueda vectorial

Representación semántica de texto

Los embeddings son representaciones numéricas (vectores) de texto que capturan su significado semántico. Los textos con significados similares tendrán vectores cercanos en el espacio vectorial, lo que permite hacer búsquedas por similitud.

Cómo funciona

# Texto original

"El gato durmió en el sofá"

↓ Modelo de embeddings

# Vector (simplificado)

[0.23, -0.45, 0.67, 0.12, -0.89, ...]

* Los vectores reales tienen 768-3072 dimensiones

Modelos de embeddings populares

text-embedding-3-large OpenAI
3072 dim
voyage-large-2 Voyage AI
1536 dim
all-MiniLM-L6-v2 Sentence Transformers
384 dim
nomic-embed-text Nomic AI (Open)
768 dim
🗄️

Pinecone

DB vectorial administrada

🔍

Weaviate

Open source

⚡

Chroma

Ligero y sencillo

4

Estrategias de chunking

División inteligente de documentos

La fragmentación es el proceso de dividir documentos grandes en segmentos más pequeños para indexarlos. La estrategia de fragmentación impacta directamente en la calidad de la recuperación en RAG.

Estrategias de chunking

📏 Por Tamaño Fijo

Divide en chunks de N tokens con overlap

chunk_size=512, overlap=50

📝 Por estructura

Respeta la estructura del documento (párrafos, secciones, markdown)

split_by="heading" ou "paragraph"

🧠 Semántico

Usa embeddings para identificar cambios de tema

similarity_threshold=0.85

🔄 Recursivo

Prueba primero con separadores más grandes y luego con los más pequeños

separators=["\n\n", "\n", ". ", " "]

Consejo de oro

No existe un tamaño de chunk perfecto. Prueba valores entre 256-1024 tokens y evalúa empíricamente cuál funciona mejor para tu caso de uso específico.

5

Evaluación de prompts

Métricas y metodologías de prueba

Evaluar la calidad de los prompts y sistemas de IA es esencial para la mejora continua. Una buena metodología de evaluación combina métricas automáticas con revisión humana.

Framework de evaluación

📊 Métricas automáticas

  • Relevancia: Cosine similarity con gold standard
  • Precisión: % de respuestas correctas
  • Recall: % de información recuperada
  • Latencia: Tiempo de respuesta

👥 Evaluación humana

  • Utilidad: ¿La respuesta ayuda al usuario?
  • Claridad: ¿Es fácil de entender?
  • Veracidad: ¿Información correcta?
  • Completitud: ¿Aborda todos los puntos?

Metodología de Prueba

1

Crear dataset de prueba

Recopila ejemplos representativos con respuestas esperadas

2

Definir las métricas

Elige métricas alineadas con tus objetivos de negocio

3

Probar variaciones

Compara distintas versiones del prompt (pruebas A/B)

4

Analizar e iterar

Usa los conocimientos obtenidos para mejorar continuamente

6

Prompts en producción

Deploy, monitoreo y escalabilidad

Llevar sistemas de IA a producción requiere prestar atención a aspectos como el control de versiones, la supervisión, la seguridad, los costos y la escalabilidad. Un deploy bien hecho garantiza la confiabilidad y permite mejoras continuas.

Lista de verificación de producción

Control de versiones

  • • Control de versiones de prompts
  • • Historial de cambios
  • • Reversión fácil

Monitoreo

  • • Registros de solicitudes
  • • Métricas de calidad
  • • Alertas de anomalías

Seguridad

  • • Limitación de solicitudes
  • • Sanitización de entradas
  • • Protección de datos

Costos

  • • Seguimiento de tokens
  • • Optimización de prompts
  • • Caché de respuestas

Arquitectura de referencia

┌─────────────────────────────────────────┐

│ USUARIOS │

└──────────────────┬──────────────────────┘

│

▼

┌─────────────────────────────────────────┐

│ API Gateway (límite de solicitudes, autenticación) │

└──────────────────┬──────────────────────┘

│

▼

┌─────────────────────────────────────────┐

│ Servicio de prompts (plantillas, caché) │

└───────┬─────────────────────┬───────────┘

│ │

▼ ▼

┌───────────────┐ ┌───────────────────┐

│ Base de datos vectorial │ │ API de LLM │

│ (RAG) │ │ (OpenAI, etc.) │

└───────────────┘ └───────────────────┘

7

Proyecto final integrador

Aplicación de todos los conceptos del nivel técnico

El proyecto final es la oportunidad de demostrar dominio de las técnicas aprendidas. Construirás un sistema completo de Q&A con RAG sobre una base de conocimiento de tu elección.

Especificación del proyecto

🎯 Objetivo

Crear un asistente especializado de Q&A que responda preguntas sobre un dominio específico (documentación técnica, manual de producto, base legal, etc.)

📋 Requisitos

  • • Pipeline RAG completo (ingesta, chunking, embedding, retrieval)
  • • System prompt profesional con persona y guardrails
  • • Formato estructurado de respuestas
  • • Cita de fuentes en las respuestas
  • • Tratamiento de preguntas fuera del alcance

📦 Entregables

  • 1. Documentación de la arquitectura
  • 2. System prompt completo y comentado
  • 3. Código/configuración del pipeline RAG
  • 4. Dataset de prueba con más de 20 preguntas
  • 5. Informe de evaluación con métricas

Rúbrica de evaluación

Arquitectura y diseño 20%
Calidad del System Prompt 25%
Implementación de RAG 25%
Evaluación y pruebas 15%
Documentación 15%

🎓 ¡Felicidades!

Al completar este proyecto, habrás demostrado competencia en ingeniería de prompts a nivel técnico. Estás listo para la Nivel Masterclass!

Módulo 5: Prompts de sistema Ir al Nivel Masterclass