Mapa de la ruta
Contenido detallado
🧪 Órdenes ocultas
Cómo un texto externo le da órdenes al agente, la prueba de la rima para verlo sin riesgo y las barreras que lo contienen.
Una instrucción colocada dentro de un correo electrónico, PDF o sitio web que el agente lee y obedece. Nombre técnico: inyección de prompt.
Quien escribe el texto pasa a controlar el agente, sin invadir nada, solo enviando un correo electrónico.
Orden oculta, contenido externo, texto invisible, cambio de responsable.
Correo electrónico, PDF, página web, comentario en una hoja de cálculo, currículum y factura: todo lo que el agente lee como parte del trabajo.
No se puede evitar que lea; sí puedes controlar lo que puede hacer después de leer.
Puerta de entrada, anexo, navegación, fuentes × herramientas.
Un aviso tuyo con una línea escondida que pide «responde con rima», en dos rondas: sin regla y con regla.
Ver al propio chat obedeciendo convence más que cualquier explicación, y no tiene ningún riesgo.
Prueba de la rima, conversación nueva, sin conectores, dos rondas.
Para el modelo, tus instrucciones y el correo externo llegan como una sola fila de texto, sin etiqueta de propietario.
Explica por qué ninguna regla escrita elimina el riesgo y por qué la aprobación sigue siendo necesaria.
Fila única, sin etiqueta, entrenado para obedecer, reduce el riesgo, pero no lo elimina.
Leer ≠ actuar, pocas herramientas conectadas, desconfiar de la urgencia que viene de fuera y pedir aprobación antes de enviar.
Ninguna defensa resuelve el problema por sí sola. Apiladas, la última detiene lo que las otras dejan pasar.
Leer ≠ actuar, menos herramientas, la urgencia se convierte en una pregunta, aprobación.
Un bloque listo para las instrucciones fijas del agente: lo que viene de afuera es información; las órdenes solo vienen de ti.
Es la primera barrera y la más barata, siempre que conozcas su límite real.
Instrucciones fijas, avisar en lugar de obedecer, límite honesto.
🗝️ Contraseñas y extensiones
Secretos, el archivo de claves que el agente puede ver, extensiones que heredan tus permisos y la lista de verificación ante filtraciones.
Todo lo que demuestra a un sistema que «soy yo». Incluye la clave de API: la contraseña de la puerta entre programas.
Quien tiene el secreto entra como si fueras tú. El sistema no verifica a la persona, solo la clave.
Secreto, API, clave de API, token.
Las claves suelen estar en un archivo de configuración, como .env, en la carpeta a la que accede el agente.
Acceder a la carpeta significa acceder a todo lo que contiene, incluidas las claves si nadie las separa.
.env, acceso a la carpeta, bóveda, imprimir = filtrar información.
No pegas secretos en el chat y el agente no muestra secretos en la pantalla. Regla lista para las instrucciones.
El historial guarda todo lo que ingresa. Un secreto pegado en el chat pasa a estar guardado en el chat.
Historial, no pegar, no imprimir, [SEGREDO OCULTO].
Programas de otras personas que se instalan en el navegador, el chat o el agente y heredan sus permisos.
Instalarlo es contratar a un desconocido para que trabaje dentro de tu oficina.
Extensión, tus permisos, pide × promete, actualización.
Tres preguntas en dos minutos: quién lo publicó, qué pide y si realmente lo necesitas.
Evita la mayoría de los problemas, y muchas extensiones hacen lo que el chat ya hace sin instalar nada.
Quién publicó, lista de permisos, si realmente lo necesito, perfil de prueba.
Revoca, crea una clave nueva, reemplázala donde la usabas y revisa el gasto, con una lista de verificación lista para completar hoy.
Eliminar el mensaje no resuelve el problema. El día de la filtración, no querrás buscar dónde está el botón.
Revoca, crea una clave nueva, reemplázala y revisa el gasto.
💸 Gasto, aislamiento y LGPD
Límite de gasto y de esfuerzo, entorno aislado para el agente, la LGPD en una página y la lista de verificación de las cuatro puertas.
Límite mensual en la cuenta, alerta de consumo y tarjeta virtual solo para servicios de IA.
Un agente en un ciclo gasta en cada vuelta. Sin un límite, te enteras cuando llega la factura.
Límite de gasto, alerta, tarjeta virtual, peor caso.
Límites de tiempo, intentos, mensajes y recursos de la máquina, y qué hace el agente cuando los alcanza.
Un ciclo sin límite consume dinero, tiempo y capacidad de la máquina al mismo tiempo. La corrección suele ser una línea.
Bucle, tiempo máximo, intentos, detenerse y avisar.
Carpeta limitada, cuenta separada o caja de arena (sandbox/contenedor): un espacio delimitado para que el agente trabaje.
Si se equivoca o lo engañan, el daño queda ahí dentro, lejos del banco y de tus claves.
Entorno aislado, contenedor, carpeta limitada, copia.
Datos personales, datos sensibles, base legal, finalidad, necesidad y derechos del titular, aplicados al agente.
La ley se aplica igual cuando quien lee la hoja de cálculo es una IA. Tú sigues siendo responsable.
Datos personales, datos sensibles, base legal, finalidad.
Quita las columnas que la tarea no usa y reemplaza los nombres por códigos antes de que el dato llegue al agente.
El agente trabaja igual y lo que se filtre vale mucho menos.
Minimizar, anonimizar, tabla clave, antes y no después.
Lista de verificación única con las cuatro puertas para el agente que elegiste al comienzo del curso.
Reúne la Ruta 4 en un solo documento y alimenta el bloque «seguridad» de la hoja de cálculo de la Ruta 5.
Cuatro puertas, responsable, fecha, puerta abierta = agente apagado.