⚠ Superficies de ataque en IA
Los asistentes de IA tienen superficies de ataque radicalmente distintas a las del software tradicional. El el vector primario es el prompt — lenguaje natural que el LLM interpreta como instrucciones. Cualquier texto que llega al contexto es potencialmente un vector de ataque.
📌 Superficies principales
Cada superficie requiere una estrategia de defensa diferente:
- •Prompt directo: mensajes del usuario que manipulan el comportamiento
- •Contenido externo: páginas web, correos electrónicos, documentos con injection
- •Memoria: envenenamiento de la base de datos de memoria con hechos falsos
- •Herramientas: parámetros maliciosos enviados a las herramientas
💡 Consejo práctico
Identifica todas las fuentes de datos que consume tu Jarvis. Cada fuente externa es una posible superficie de ataque.
🎯 Modelo de amenazas
El modelo de amenazas identifica quiénes son los adversarios, qué quieren y cómo intentarán conseguirlo. Para un asistente personal, los riesgos son diferentes a los de una IA corporativa.
📌 Adversarios del Jarvis Personal
Cada tipo de adversario tiene capacidades y objetivos distintos:
- •Usuarios curiosos: ponen a prueba los límites del sistema por diversión
- •Contenido malicioso: páginas y correos electrónicos con injection pasivo
- •Scripts automatizados: intentos de abuso mediante API
- •Atacante sofisticado: objetivo de exfiltrar datos o ejecutar acciones destructivas
💡 Consejo práctico
Prioriza las defensas contra los adversarios más probables, no contra los más sofisticados. Para uso personal, el riesgo real es el contenido malicioso pasivo.
🔐 IA ≠ seguridad web
Los desarrolladores con experiencia en web suelen aplicar técnicas como la sanitización de entradas y el escape de SQL. En IA, estos controles no funcionan porque el input se interpreta semánticamente, no se ejecuta literalmente.
📌 Diferencias fundamentales
Qué cambia de la seguridad web a la seguridad de la IA:
- •Web: escapa <script>. IA: no se puede «escapar» del lenguaje natural
- •Web: valida tipos de datos. IA: el «tipo» es la intención humana — indetectable
- •Web: el firewall bloquea IPs. IA: el atacante usa el mismo canal que el usuario legítimo
- •Web: CVE conocidos. IA: se descubren nuevos vectores cada semana
💡 Consejo práctico
Usa técnicas de seguridad web como base, pero añade capas específicas para IA: etiquetado de contenido, puntos de aprobación y un entorno aislado de ejecución.
🏰 Zero-Trust para IA
Zero-Trust significa: nunca confiar, siempre verificar. En IA, esto se aplica no a la identidad del usuario (autenticación), sino a cada acción específica que el asistente quiere ejecutar.
📌 Principios de confianza cero en IA
Aplicación práctica del modelo Zero-Trust:
- •Verifica la acción, no solo al usuario: usuario autenticado ≠ acción autorizada
- •Privilegios mínimos: cada herramienta solo tiene acceso a lo estrictamente necesario
- •Aprobación explícita: las acciones de alto impacto siempre necesitan confirmación humana
- •Verificación continua: no asume que el contexto no se haya comprometido
💡 Consejo práctico
Implementa Zero-Trust empezando por las acciones más destructivas (delete, execute, send). Merecen gates de aprobación explícitos.
📊 Casos reales de ataques
Los ataques de prompt injection no son teóricos. Casos documentados en Bing Chat, Claude y otros muestran que cualquier asistente que procesa contenido externo está expuesto si no cuenta con las defensas adecuadas.
📌 Incidentes documentados
Casos reales que dieron forma a las defensas de INTELECTO:
- •Bing Chat: una página web con injection que hacía que el bot cambiara de identidad y revelara el system prompt
- •Claude vía correo electrónico: indirect injection que intentaba exfiltrar datos a una URL externa
- •GPT-4 a través de un documento: instrucciones ocultas en texto blanco sobre fondo blanco en archivos PDF
- •AutoGPT: injection mediante un resultado de búsqueda web que manipula los siguientes pasos
💡 Consejo práctico
Todos estos ataques usan el mismo vector: contenido no confiable en el contexto. Marcar explícitamente en el prompt qué contenido es «externo» reduce significativamente el riesgo.
🗺 Defensa en profundidad
Ninguna defensa individual es 100% eficaz. Defensa en profundidad apila varias capas independientes: si una falla, la siguiente detiene el ataque.
📌 Las 5 capas de INTELECTO
Cada capa cubre vectores que las demás no cubren:
- •Capa 1: Validación de entrada y lista de bloqueo de palabras clave
- •Capa 2: Detección de patrones de inyección con heurísticas
- •Capa 3: Puerta de aprobación para acciones de alto impacto
- •Capa 4: Sandbox de ejecución para las tools
- •Capa 5: Registro de auditoría para la detección posterior
💡 Consejo práctico
Implementa las capas en orden de costo-beneficio. Blocklist (Capa 1) es gratuita. Sandbox (Capa 4) tiene overhead. Empieza por la 1 y ve agregando.
✅ Resumen del Módulo 3.1
Siguiente:
3.2 — Inyección de prompts y defensas