Descripción general de los módulos
Haz clic en una tarjeta para acceder al módulo completo.
Contenido detallado
Explora los temas de cada módulo. Haz clic para expandir.
🏗️ Arquitectura y rendimiento
OLTP vs. OLAP, particionamiento, data warehouse, ETL, observabilidad y gobernanza de datos.
OLTP procesa transacciones en tiempo real. OLAP analiza grandes volúmenes de datos históricos.
Mezclar cargas OLTP y OLAP en la misma base de datos degrada ambas. Separarlas es ingeniería.
Transaccional vs. analítico, row-store vs. column-store, ETL, ELT
Dividir tablas grandes en particiones más pequeñas según un criterio (fecha, rango, hash).
Las tablas con miles de millones de filas se vuelven inmanejables. La partición mejora las queries y el mantenimiento.
Partición por rango, partición por hash, partición por lista, eliminación de particiones innecesarias
Políticas que definen cuánto tiempo conservar los datos y cómo archivar los antiguos.
Cumplimiento normativo (LGPD, GDPR), costo del almacenamiento, rendimiento. Los datos eternos son una deuda.
Política de retención, almacenamiento en frío, almacenamiento por niveles, tareas de purga
Repositorio centralizado optimizado para consultas analíticas y BI.
Los datos dispersos en 10 sistemas no generan insights. Un DW los consolida y permite analizarlos.
Star schema, Snowflake schema, fact tables, dimension tables, BigQuery, Redshift
Procesos que extraen, transforman y cargan datos entre sistemas.
Los datos sin procesar necesitan limpieza y transformación antes de ser útiles.
ETL vs. ELT, procesamiento por lotes vs. streaming, Airflow, dbt, verificaciones de calidad de datos
Capacidad de entender el estado interno de la base de datos mediante métricas, logs y trazas.
Una base de datos sin monitoreo es una bomba de tiempo. Los incidentes son inevitables; la falta de visibilidad, no.
Métricas (latencia, throughput, errores), logs, APM, alertas, SLOs, pg_stat_statements
Marco de políticas, procesos y responsabilidades sobre los datos.
Sin gobernanza, los datos se vuelven basura. La calidad, la seguridad y el compliance dependen de ella.
Catálogo de datos, linaje de datos, RBAC, auditoría, clasificación de datos
🤖 IA aplicada a datos
Ventana de contexto, RAG, pgvector, Weaviate, Milvus, Qdrant, Redis Vectorial, Chroma y Azure AI Search.
Cantidad máxima de tokens que un LLM procesa a la vez.
Si se excede la ventana, se pierde información. Saber dimensionarla es un requisito para usar IA con datos.
Tokens, ventana de contexto, compresión, resumen, priorización por relevancia
Técnica que busca datos relevantes y los inyecta en el prompt antes de generar una respuesta.
Los LLM no conocen tus datos internos. RAG permite chatear sobre tu base de conocimientos.
Fragmentación, embeddings, indexación vectorial, reranking, pipeline RAG
Extensión que agrega el tipo VECTOR a PostgreSQL para búsquedas por similitud.
Usa el PostgreSQL que ya tienes. Sin infraestructura extra para casos de hasta ~1M de vectores.
CREATE EXTENSION vector, VECTOR(1536), operadores <=>, ivfflat, HNSW
Base de datos vectorial con búsqueda híbrida (semántica + palabras clave).
La búsqueda puramente semántica pierde términos exactos. La híbrida combina lo mejor de ambas.
nearVector, BM25, hybrid search, modules, multi-tenancy
Base de datos vectorial de código abierto diseñada para miles de millones de vectores.
Cuando pgvector ya no escala, Milvus es la opción de código abierto más madura.
Collection, FLOAT_VECTOR, IVF_FLAT, HNSW, GPU acceleration
Qdrant almacena vectores con payload filtrable. Redis FTS agrega vectores a Redis.
Qdrant para filtros complejos + semántica. Redis para quienes ya usan Redis y quieren vectores.
Qdrant payload, cosine distance, Redis VECTOR HNSW, FT.SEARCH KNN
Chroma es ligero para desarrollo local. Azure AI Search es una solución empresarial administrada.
Chroma para crear prototipos rápidamente. Azure para producción con SLA e integración con Microsoft.
chromadb.Client(), Azure vectorSearch, HNSW, skillset, reranking