PTENES
MÓDULO 3.3

🗄️ Auditoría de datos e infraestructura

"Datos malos, IA mala." Antes de cualquier modelo, necesitas saber qué existe, dónde está, si es confiable y si se puede usar legalmente. Esta auditoría es el trabajo que haces antes del trabajo.

6
Temas
~45
Minutos
Audit
Nivel
Datos
Tipo

GIGO: Garbage In, Garbage Out. No importa qué modelo de IA elijas — si los datos de entrada son malos, el resultado será malo. La auditoría de datos es lo que distingue al consultor que logra resultados de quien vende esperanzas con tecnología costosa.

🗄️ ERP/CRM 📊 Hojas de cálculo 📄 Documentos 🌐 APIs ext. 🔬 Auditoría Inventario · Calidad Acceso · LGPD Preparación para RAG/entrenamiento 🧠 Modelo de IA dato listo → resultado útil dato deficiente → corregir primero ✅ resultado

La auditoría filtra lo que entra en el modelo: los datos deficientes se devuelven para corregirlos antes de avanzar.

1

📦 Inventario de datos

No puedes auditar lo que no conoces. El primer paso es mapear todos los repositorios de datos de la organización, incluidos los que nadie mantiene oficialmente (shadow IT) y los que están en silos que nadie puede conectar.

🗺️ Qué mapear en el inventario

  • •Sistemas transaccionales — ERP, CRM, comercio electrónico, sistemas financieros.
  • •Hojas de cálculo y documentos — la "shadow IT" de datos en Excel/Sheets, Google Docs, Word.
  • •Archivos no estructurados — PDFs, correos electrónicos, imágenes, audios de atención al cliente.
  • •API externas — datos de terceros que usa la empresa (Google Analytics, plataformas de anuncios, etc.).

💡 Sorpresa común en el inventario

Por lo general, las empresas subestiman sus datos no estructurados. Una empresa de servicios puede tener 5 años de correos electrónicos de atención al cliente: un activo potencial para RAG o el análisis de sentimientos que nadie identificó como dato porque «el correo electrónico no es un dato».

2

🔬 Calidad de los datos — las 4 dimensiones

Tener datos no es suficiente: deben tener calidad en las 4 dimensiones que determinan si son utilizables por modelos de IA. Una falla en cualquier dimensión puede volver el dato inútil o peligroso.

1

Completitud

¿Qué % de los campos críticos está completo? <80% en un campo crítico es un problema. Los campos vacíos producen predicciones imprecisas o errores de procesamiento.

Métrica: % de campos completados por tabla/fuente

2

Consistencia

¿El mismo dato tiene el mismo formato en todos los sistemas? "SP", "São Paulo", "São Paulo - SP" en el mismo campo son 3 entidades diferentes para un modelo.

Métrica: % de entradas con formato estandarizado

3

Actualidad

Es posible que los datos de hace 3 años no reflejen los patrones actuales del negocio, especialmente después de la pandemia o de cambios en el producto o el mercado. Los datos obsoletos producen predicciones desactualizadas.

Métrica: fecha de la última actualización; período útil

4

Ausencia de sesgo

¿La muestra representa el universo al que atenderá el modelo? Los datos de clientes de una sola región, grupo etario o segmento generan modelos que discriminan a los demás, y muchas veces de forma ilegal.

Métrica: distribución por grupos relevantes para el caso de uso

⚠️ Alerta: datos malos, IA mala

Ni la ingeniería de prompts, ni un modelo costoso, ni una cantidad de GPU compensan los datos deficientes. Si la auditoría revela una calidad crítica por debajo del mínimo, la recomendación profesional es: corrige los datos antes de iniciar el proyecto de IA.

3

🔗 Acceso e integración

Un dato de calidad en un sistema inaccesible es tan inútil como un dato deficiente. La auditoría de acceso verifica si se puede acceder a los datos conectados a los componentes de IA sin necesidad de exportaciones manuales improvisadas.

✓ Acceso adecuado

  • ✓API REST documentada y estable
  • ✓Exportación automatizable (webhook/cron)
  • ✓Permisos claros: quién accede a qué
  • ✓Dato accesible en tiempo real o near-real-time

✗ Acceso bloqueado

  • ✗Sistema heredado sin API; solo exportación manual
  • ✗Dato aislado en un área que no lo comparte
  • ✗Base de datos accesible solo a través de la VPN interna
  • ✗Dependencia del proveedor — el proveedor controla los datos
4

🔒 LGPD, privacidad y soberanía de datos

Usar datos personales en proyectos de IA sin base legal no es solo un riesgo jurídico: también es un riesgo reputacional. La LGPD define reglas claras que el consultor necesita conocer y comunicar antes de proponer cualquier uso de datos de clientes o colaboradores en modelos.

⚖️ Qué verificar con respecto a la LGPD

  • •Base legal: ¿el dato se recopiló con consentimiento o con una base legítima para el uso propuesto?
  • •Finalidad: ¿usar el dato en un modelo de IA está dentro de la finalidad declarada al recopilarlo?
  • •Minimización: ¿vas a usar solo los datos necesarios para la finalidad?
  • •RAG con datos internos: los documentos internos con datos personales necesitan tratamiento antes de ir al vector store.
Base legal

consentimiento o interés legítimo

Finalidad

IA dentro del alcance de la recopilación

Minimización

solo el dato necesario

DPO

involucrar antes, no después

5

🧠 Preparación para RAG y fine-tuning

Los dos enfoques más comunes para personalizar LLMs requieren tipos de datos completamente diferentes. La auditoría define qué es viable — y el consultor que propone fine-tuning para una empresa sin datos etiquetados está cometiendo un error costoso.

RAG — Retrieval-Augmented Generation

El modelo consulta una base de documentos en tiempo real. El dato ideal es:

  • • Documentos de texto con contenido relevante
  • • Pueden no estar estructurados (PDFs, Word, correos electrónicos)
  • • Deben ser «divisibles en partes»
  • • Se admite la actualización frecuente

Requiere: documentos organizados + pipeline de indexación

Fine-tuning

El modelo se entrena o ajusta con datos específicos. El dato ideal es:

  • • Pares de input/output de alta calidad
  • • Mínimo de 500-1000 ejemplos (idealmente más)
  • • Consistentes y representativos del uso real
  • • Etiquetados por especialistas del área

Requiere: datos etiquetados de calidad, un activo escaso

💡 Regla de oro

Para la mayoría de las empresas brasileñas, RAG es el enfoque adecuado: más rápido, más barato, con datos actualizables y sin necesidad de datos etiquetados. El fine-tuning se reserva para los casos en que RAG realmente no resuelve el problema y existen datos de entrenamiento de calidad.

6

🩺 Entregable: informe sobre el estado de los datos

El producto final de la auditoría es un informe objetivo que documenta lo que se encontró, califica la calidad por dimensión y declara si los datos están listos para cada caso de uso — o qué se debe remediar primero.

📋 Estructura del informe

1. Inventario: lista de fuentes de datos con tipo, volumen y responsable
2. Score de calidad: notas por dimensión (completitud, consistencia, actualidad, sesgo) por fuente
3. Problemas críticos: qué bloquea el proyecto si no se corrige
4. Preparación por caso de uso: declaración por caso de uso (Listo / Listo con restricciones / No listo)
5. Plan de remediación: acciones prioritarias con responsable y plazo estimado
✅ Listo

puede avanzar al proyecto

⚠️ Restricción

un alcance limitado es viable

🛑 No está listo

remediar antes de avanzar

📌 Remediación

plazo y responsable definidos

🎒 Resumen del módulo

✓
Primero, el inventario — no puedes auditar lo que no has mapeado.
✓
4 dimensiones de calidad — integridad, consistencia, actualidad y ausencia de sesgo.
✓
LGPD es un requisito, no es opcional — involucrar al DPO antes de proponer el uso de datos personales en IA.
✓
RAG antes que fine-tuning — para la mayoría de las empresas, RAG es viable; el fine-tuning necesita datos etiquetados de calidad.

Siguiente módulo:

3.4 — Gobernanza y riesgo: NIST AI RMF, ISO 42001, EU AI Act — cómo estructurar controles proporcionales