PTENES
RUTA 3

🚀 Arquitectura e IA

Domina la arquitectura de datos, el rendimiento a escala y la IA aplicada a bases de datos. Desde OLTP/OLAP hasta bases de datos vectoriales y RAG.

2
Módulos
14
Temas
~2h
Duración
🚀
Avanzado

Descripción general de los módulos

Haz clic en una tarjeta para acceder al módulo completo.

Contenido detallado

Explora los temas de cada módulo. Haz clic para expandir.

3.1 ~50 min

🏗️ Arquitectura y rendimiento

OLTP vs. OLAP, particionamiento, data warehouse, ETL, observabilidad y gobernanza de datos.

Qué es:

OLTP procesa transacciones en tiempo real. OLAP analiza grandes volúmenes de datos históricos.

Por qué aprender:

Mezclar cargas OLTP y OLAP en la misma base de datos degrada ambas. Separarlas es ingeniería.

Conceptos clave:

Transaccional vs. analítico, row-store vs. column-store, ETL, ELT

Qué es:

Dividir tablas grandes en particiones más pequeñas según un criterio (fecha, rango, hash).

Por qué aprender:

Las tablas con miles de millones de filas se vuelven inmanejables. La partición mejora las queries y el mantenimiento.

Conceptos clave:

Partición por rango, partición por hash, partición por lista, eliminación de particiones innecesarias

Qué es:

Políticas que definen cuánto tiempo conservar los datos y cómo archivar los antiguos.

Por qué aprender:

Cumplimiento normativo (LGPD, GDPR), costo del almacenamiento, rendimiento. Los datos eternos son una deuda.

Conceptos clave:

Política de retención, almacenamiento en frío, almacenamiento por niveles, tareas de purga

Qué es:

Repositorio centralizado optimizado para consultas analíticas y BI.

Por qué aprender:

Los datos dispersos en 10 sistemas no generan insights. Un DW los consolida y permite analizarlos.

Conceptos clave:

Star schema, Snowflake schema, fact tables, dimension tables, BigQuery, Redshift

Qué es:

Procesos que extraen, transforman y cargan datos entre sistemas.

Por qué aprender:

Los datos sin procesar necesitan limpieza y transformación antes de ser útiles.

Conceptos clave:

ETL vs. ELT, procesamiento por lotes vs. streaming, Airflow, dbt, verificaciones de calidad de datos

Qué es:

Capacidad de entender el estado interno de la base de datos mediante métricas, logs y trazas.

Por qué aprender:

Una base de datos sin monitoreo es una bomba de tiempo. Los incidentes son inevitables; la falta de visibilidad, no.

Conceptos clave:

Métricas (latencia, throughput, errores), logs, APM, alertas, SLOs, pg_stat_statements

Qué es:

Marco de políticas, procesos y responsabilidades sobre los datos.

Por qué aprender:

Sin gobernanza, los datos se vuelven basura. La calidad, la seguridad y el compliance dependen de ella.

Conceptos clave:

Catálogo de datos, linaje de datos, RBAC, auditoría, clasificación de datos

📄 Ver completo
3.2 ~70 min

🤖 IA aplicada a datos

Ventana de contexto, RAG, pgvector, Weaviate, Milvus, Qdrant, Redis Vectorial, Chroma y Azure AI Search.

Qué es:

Cantidad máxima de tokens que un LLM procesa a la vez.

Por qué aprender:

Si se excede la ventana, se pierde información. Saber dimensionarla es un requisito para usar IA con datos.

Conceptos clave:

Tokens, ventana de contexto, compresión, resumen, priorización por relevancia

Qué es:

Técnica que busca datos relevantes y los inyecta en el prompt antes de generar una respuesta.

Por qué aprender:

Los LLM no conocen tus datos internos. RAG permite chatear sobre tu base de conocimientos.

Conceptos clave:

Fragmentación, embeddings, indexación vectorial, reranking, pipeline RAG

Qué es:

Extensión que agrega el tipo VECTOR a PostgreSQL para búsquedas por similitud.

Por qué aprender:

Usa el PostgreSQL que ya tienes. Sin infraestructura extra para casos de hasta ~1M de vectores.

Conceptos clave:

CREATE EXTENSION vector, VECTOR(1536), operadores <=>, ivfflat, HNSW

Qué es:

Base de datos vectorial con búsqueda híbrida (semántica + palabras clave).

Por qué aprender:

La búsqueda puramente semántica pierde términos exactos. La híbrida combina lo mejor de ambas.

Conceptos clave:

nearVector, BM25, hybrid search, modules, multi-tenancy

Qué es:

Base de datos vectorial de código abierto diseñada para miles de millones de vectores.

Por qué aprender:

Cuando pgvector ya no escala, Milvus es la opción de código abierto más madura.

Conceptos clave:

Collection, FLOAT_VECTOR, IVF_FLAT, HNSW, GPU acceleration

Qué es:

Qdrant almacena vectores con payload filtrable. Redis FTS agrega vectores a Redis.

Por qué aprender:

Qdrant para filtros complejos + semántica. Redis para quienes ya usan Redis y quieren vectores.

Conceptos clave:

Qdrant payload, cosine distance, Redis VECTOR HNSW, FT.SEARCH KNN

Qué es:

Chroma es ligero para desarrollo local. Azure AI Search es una solución empresarial administrada.

Por qué aprender:

Chroma para crear prototipos rápidamente. Azure para producción con SLA e integración con Microsoft.

Conceptos clave:

chromadb.Client(), Azure vectorSearch, HNSW, skillset, reranking

📄 Ver completo