GIGO: Garbage In, Garbage Out. No importa qué modelo de IA elijas — si los datos de entrada son malos, el resultado será malo. La auditoría de datos es lo que distingue al consultor que logra resultados de quien vende esperanzas con tecnología costosa.
La auditoría filtra lo que entra en el modelo: los datos deficientes se devuelven para corregirlos antes de avanzar.
📦 Inventario de datos
No puedes auditar lo que no conoces. El primer paso es mapear todos los repositorios de datos de la organización, incluidos los que nadie mantiene oficialmente (shadow IT) y los que están en silos que nadie puede conectar.
🗺️ Qué mapear en el inventario
- •Sistemas transaccionales — ERP, CRM, comercio electrónico, sistemas financieros.
- •Hojas de cálculo y documentos — la "shadow IT" de datos en Excel/Sheets, Google Docs, Word.
- •Archivos no estructurados — PDFs, correos electrónicos, imágenes, audios de atención al cliente.
- •API externas — datos de terceros que usa la empresa (Google Analytics, plataformas de anuncios, etc.).
💡 Sorpresa común en el inventario
Por lo general, las empresas subestiman sus datos no estructurados. Una empresa de servicios puede tener 5 años de correos electrónicos de atención al cliente: un activo potencial para RAG o el análisis de sentimientos que nadie identificó como dato porque «el correo electrónico no es un dato».
🔬 Calidad de los datos — las 4 dimensiones
Tener datos no es suficiente: deben tener calidad en las 4 dimensiones que determinan si son utilizables por modelos de IA. Una falla en cualquier dimensión puede volver el dato inútil o peligroso.
Completitud
¿Qué % de los campos críticos está completo? <80% en un campo crítico es un problema. Los campos vacíos producen predicciones imprecisas o errores de procesamiento.
Métrica: % de campos completados por tabla/fuente
Consistencia
¿El mismo dato tiene el mismo formato en todos los sistemas? "SP", "São Paulo", "São Paulo - SP" en el mismo campo son 3 entidades diferentes para un modelo.
Métrica: % de entradas con formato estandarizado
Actualidad
Es posible que los datos de hace 3 años no reflejen los patrones actuales del negocio, especialmente después de la pandemia o de cambios en el producto o el mercado. Los datos obsoletos producen predicciones desactualizadas.
Métrica: fecha de la última actualización; período útil
Ausencia de sesgo
¿La muestra representa el universo al que atenderá el modelo? Los datos de clientes de una sola región, grupo etario o segmento generan modelos que discriminan a los demás, y muchas veces de forma ilegal.
Métrica: distribución por grupos relevantes para el caso de uso
⚠️ Alerta: datos malos, IA mala
Ni la ingeniería de prompts, ni un modelo costoso, ni una cantidad de GPU compensan los datos deficientes. Si la auditoría revela una calidad crítica por debajo del mínimo, la recomendación profesional es: corrige los datos antes de iniciar el proyecto de IA.
🔗 Acceso e integración
Un dato de calidad en un sistema inaccesible es tan inútil como un dato deficiente. La auditoría de acceso verifica si se puede acceder a los datos conectados a los componentes de IA sin necesidad de exportaciones manuales improvisadas.
✓ Acceso adecuado
- ✓API REST documentada y estable
- ✓Exportación automatizable (webhook/cron)
- ✓Permisos claros: quién accede a qué
- ✓Dato accesible en tiempo real o near-real-time
✗ Acceso bloqueado
- ✗Sistema heredado sin API; solo exportación manual
- ✗Dato aislado en un área que no lo comparte
- ✗Base de datos accesible solo a través de la VPN interna
- ✗Dependencia del proveedor — el proveedor controla los datos
🔒 LGPD, privacidad y soberanía de datos
Usar datos personales en proyectos de IA sin base legal no es solo un riesgo jurídico: también es un riesgo reputacional. La LGPD define reglas claras que el consultor necesita conocer y comunicar antes de proponer cualquier uso de datos de clientes o colaboradores en modelos.
⚖️ Qué verificar con respecto a la LGPD
- •Base legal: ¿el dato se recopiló con consentimiento o con una base legítima para el uso propuesto?
- •Finalidad: ¿usar el dato en un modelo de IA está dentro de la finalidad declarada al recopilarlo?
- •Minimización: ¿vas a usar solo los datos necesarios para la finalidad?
- •RAG con datos internos: los documentos internos con datos personales necesitan tratamiento antes de ir al vector store.
consentimiento o interés legítimo
IA dentro del alcance de la recopilación
solo el dato necesario
involucrar antes, no después
🧠 Preparación para RAG y fine-tuning
Los dos enfoques más comunes para personalizar LLMs requieren tipos de datos completamente diferentes. La auditoría define qué es viable — y el consultor que propone fine-tuning para una empresa sin datos etiquetados está cometiendo un error costoso.
RAG — Retrieval-Augmented Generation
El modelo consulta una base de documentos en tiempo real. El dato ideal es:
- • Documentos de texto con contenido relevante
- • Pueden no estar estructurados (PDFs, Word, correos electrónicos)
- • Deben ser «divisibles en partes»
- • Se admite la actualización frecuente
Requiere: documentos organizados + pipeline de indexación
Fine-tuning
El modelo se entrena o ajusta con datos específicos. El dato ideal es:
- • Pares de input/output de alta calidad
- • Mínimo de 500-1000 ejemplos (idealmente más)
- • Consistentes y representativos del uso real
- • Etiquetados por especialistas del área
Requiere: datos etiquetados de calidad, un activo escaso
💡 Regla de oro
Para la mayoría de las empresas brasileñas, RAG es el enfoque adecuado: más rápido, más barato, con datos actualizables y sin necesidad de datos etiquetados. El fine-tuning se reserva para los casos en que RAG realmente no resuelve el problema y existen datos de entrenamiento de calidad.
🩺 Entregable: informe sobre el estado de los datos
El producto final de la auditoría es un informe objetivo que documenta lo que se encontró, califica la calidad por dimensión y declara si los datos están listos para cada caso de uso — o qué se debe remediar primero.
📋 Estructura del informe
puede avanzar al proyecto
un alcance limitado es viable
remediar antes de avanzar
plazo y responsable definidos
🎒 Resumen del módulo
Siguiente módulo:
3.4 — Gobernanza y riesgo: NIST AI RMF, ISO 42001, EU AI Act — cómo estructurar controles proporcionales