PTENES
MÓDULO 3.1

🛡 Fundamentos de seguridad para IA

Superficies de ataque en asistentes de IA, modelo de amenazas y por qué la seguridad en IA es radicalmente diferente de la seguridad web.

6
Temas
75
Minutos
Avanzado
Nivel
Teoría
Tipo
1

⚠ Superficies de ataque en IA

Los asistentes de IA tienen superficies de ataque radicalmente distintas a las del software tradicional. El el vector primario es el prompt — lenguaje natural que el LLM interpreta como instrucciones. Cualquier texto que llega al contexto es potencialmente un vector de ataque.

📌 Superficies principales

Cada superficie requiere una estrategia de defensa diferente:

  • •Prompt directo: mensajes del usuario que manipulan el comportamiento
  • •Contenido externo: páginas web, correos electrónicos, documentos con injection
  • •Memoria: envenenamiento de la base de datos de memoria con hechos falsos
  • •Herramientas: parámetros maliciosos enviados a las herramientas

💡 Consejo práctico

Identifica todas las fuentes de datos que consume tu Jarvis. Cada fuente externa es una posible superficie de ataque.

2

🎯 Modelo de amenazas

El modelo de amenazas identifica quiénes son los adversarios, qué quieren y cómo intentarán conseguirlo. Para un asistente personal, los riesgos son diferentes a los de una IA corporativa.

📌 Adversarios del Jarvis Personal

Cada tipo de adversario tiene capacidades y objetivos distintos:

  • •Usuarios curiosos: ponen a prueba los límites del sistema por diversión
  • •Contenido malicioso: páginas y correos electrónicos con injection pasivo
  • •Scripts automatizados: intentos de abuso mediante API
  • •Atacante sofisticado: objetivo de exfiltrar datos o ejecutar acciones destructivas

💡 Consejo práctico

Prioriza las defensas contra los adversarios más probables, no contra los más sofisticados. Para uso personal, el riesgo real es el contenido malicioso pasivo.

3

🔐 IA ≠ seguridad web

Los desarrolladores con experiencia en web suelen aplicar técnicas como la sanitización de entradas y el escape de SQL. En IA, estos controles no funcionan porque el input se interpreta semánticamente, no se ejecuta literalmente.

📌 Diferencias fundamentales

Qué cambia de la seguridad web a la seguridad de la IA:

  • •Web: escapa <script>. IA: no se puede «escapar» del lenguaje natural
  • •Web: valida tipos de datos. IA: el «tipo» es la intención humana — indetectable
  • •Web: el firewall bloquea IPs. IA: el atacante usa el mismo canal que el usuario legítimo
  • •Web: CVE conocidos. IA: se descubren nuevos vectores cada semana

💡 Consejo práctico

Usa técnicas de seguridad web como base, pero añade capas específicas para IA: etiquetado de contenido, puntos de aprobación y un entorno aislado de ejecución.

4

🏰 Zero-Trust para IA

Zero-Trust significa: nunca confiar, siempre verificar. En IA, esto se aplica no a la identidad del usuario (autenticación), sino a cada acción específica que el asistente quiere ejecutar.

📌 Principios de confianza cero en IA

Aplicación práctica del modelo Zero-Trust:

  • •Verifica la acción, no solo al usuario: usuario autenticado ≠ acción autorizada
  • •Privilegios mínimos: cada herramienta solo tiene acceso a lo estrictamente necesario
  • •Aprobación explícita: las acciones de alto impacto siempre necesitan confirmación humana
  • •Verificación continua: no asume que el contexto no se haya comprometido

💡 Consejo práctico

Implementa Zero-Trust empezando por las acciones más destructivas (delete, execute, send). Merecen gates de aprobación explícitos.

5

📊 Casos reales de ataques

Los ataques de prompt injection no son teóricos. Casos documentados en Bing Chat, Claude y otros muestran que cualquier asistente que procesa contenido externo está expuesto si no cuenta con las defensas adecuadas.

📌 Incidentes documentados

Casos reales que dieron forma a las defensas de INTELECTO:

  • •Bing Chat: una página web con injection que hacía que el bot cambiara de identidad y revelara el system prompt
  • •Claude vía correo electrónico: indirect injection que intentaba exfiltrar datos a una URL externa
  • •GPT-4 a través de un documento: instrucciones ocultas en texto blanco sobre fondo blanco en archivos PDF
  • •AutoGPT: injection mediante un resultado de búsqueda web que manipula los siguientes pasos

💡 Consejo práctico

Todos estos ataques usan el mismo vector: contenido no confiable en el contexto. Marcar explícitamente en el prompt qué contenido es «externo» reduce significativamente el riesgo.

6

🗺 Defensa en profundidad

Ninguna defensa individual es 100% eficaz. Defensa en profundidad apila varias capas independientes: si una falla, la siguiente detiene el ataque.

📌 Las 5 capas de INTELECTO

Cada capa cubre vectores que las demás no cubren:

  • •Capa 1: Validación de entrada y lista de bloqueo de palabras clave
  • •Capa 2: Detección de patrones de inyección con heurísticas
  • •Capa 3: Puerta de aprobación para acciones de alto impacto
  • •Capa 4: Sandbox de ejecución para las tools
  • •Capa 5: Registro de auditoría para la detección posterior

💡 Consejo práctico

Implementa las capas en orden de costo-beneficio. Blocklist (Capa 1) es gratuita. Sandbox (Capa 4) tiene overhead. Empieza por la 1 y ve agregando.

✅ Resumen del Módulo 3.1

✓
Superficies de ataque en IA — Prompt, contenido externo, memoria y tools son los 4 vectores principales
✓
Modelo de amenazas — Diferentes adversarios requieren diferentes prioridades de defensa
✓
IA ≠ Seguridad web — Los vectores de ataque en lenguaje natural exigen defensas específicas para IA
✓
Zero-Trust para IA — Verificación por acción, no por identidad — el principio central de Zero-Trust para IA
✓
Casos reales de ataques — La inyección vía web, correo electrónico y documentos son vectores reales y documentados
✓
Defensa en profundidad — 5 capas independientes — una solicitud maliciosa debe pasar por todas para causar daño

Siguiente:

3.2 — Inyección de prompts y defensas