📲 Dónde vive Jarvis en el celular (los canales)
No necesitas descargar ninguna app de una tienda para tener un asistente de IA en tu bolsillo. El secreto es simple y hasta un poco sorprendente: usas una app de mensajería que ya funciona en tu teléfono — Telegram o WhatsApp — como la "puerta" de tu Jarvis. En este módulo descubrirás dónde está realmente, cómo el teléfono se convierte solo en la pantalla de un agente que trabaja 24/7 y por qué es más TUYO que Siri o Gemini.
📲 El cambio: sin app de tienda
Cuando alguien se imagina «un asistente de IA en el celular», casi siempre piensa en descargar una app nueva de App Store o Play Store, crear una cuenta más, aceptar otro término de uso. El cambio en este módulo es darse cuenta de que nada de eso es necesario. Ya tienes una app de mensajería instalada y con sesión iniciada que se abre en cualquier celular del mundo: Telegram o WhatsApp. Esa app se convierte en la puerta de entrada de tu Jarvis.
Piensa así: tu asistente no es una aplicación, es un contacto. Le envías mensajes como se los envías a un amigo, y te responde en el mismo lugar. La frase que resume todo este recorrido es: "Telegram ya es móvil". Como la aplicación de mensajería funciona en iPhone, Android, la computadora y el navegador, tu Jarvis estará disponible automáticamente en todos ellos, sin que escribas una sola línea de código para una app.
🚪 Qué es un «canal»
Uno canal y es simplemente la puerta por la que conversas con el asistente. En vez de construir una app entera, reutilizas una puerta que ya existe y que todo el mundo ya sabe usar.
- •No instalas nada nuevo: usas la app de mensajería que ya está en tu teléfono.
- •El mismo asistente está disponible desde el celular, la tableta y la PC al mismo tiempo.
- •Cero mantenimiento de la app: sin build, sin aprobación de la tienda ni actualizaciones de versión.
¿Eres nuevo aquí? "App nativa" es un programa hecho a medida para iPhone o Android, que descargas de la tienda. "Canal" es la puerta de conversación del asistente. La gran idea es usar un canal que ya existe (Telegram/WhatsApp) en lugar de construir una app nativa desde cero.
Conceptos clave
La puerta para conversar con Jarvis (Telegram, WhatsApp, voz, web).
La app de mensajería lleva tu asistente a cualquier dispositivo.
Cero compilaciones, cero tienda, cero aprobaciones: solo el canal que ya existe.
Hablas con él como con un amigo de tu lista de conversaciones.
✈️ Telegram (agentejax)
O Telegram y es el canal preferido para un Jarvis de bolsillo, y el proyecto que sirve de referencia aquí se llama agentejax — un agente escrito en TypeScript que vive en Telegram, está disponible las 24 horas y está diseñado para ser simple. ¿Por qué Telegram? Porque crear un robot (un «bot») allí es increíblemente fácil: conversas con un robot oficial llamado @BotFather, te entrega un token (una contraseña larga que identifica a tu bot), y listo: ya tienes un canal.
La segunda razón es técnica, pero importante para tu seguridad: Telegram usa long-polling. En vez de que tu agente abra una "puerta" en la computadora para que todo Internet pueda tocar (lo cual es arriesgado), y el tu agente que llama a Telegram a cada instante y pregunta: "¿me llegó un mensaje nuevo?". Resultado: ningún puerto expuesto, ningún servidor web abierto al mundo — una falla de seguridad menos.
🛡️ El primer bloqueo: la whitelist
Cualquier persona puede encontrar un bot de Telegram de forma predeterminada. Sin protección, un desconocido podría escribirle y usar TU asistente (y TU cuenta de IA). El control se llama lista de permitidos: una lista con tu user ID (el número único de tu cuenta de Telegram). El agente solo atiende a quienes están en la lista; ignora en silencio a cualquier otra persona.
- •Solo tu ID: solo tú recibes la respuesta.
- •Los demás desaparecen: los mensajes externos ni siquiera generan una respuesta: no hay forma de adivinar que hay un bot ahí.
- •Seguridad predeterminada: la puerta queda cerrada para todos, menos para el dueño.
Lectura del diagrama: tu mensaje sale del celular, pasa por el Telegram (que no abre ninguna puerta en tu agente, gracias al long-polling), llega al agente ejecutándose en la nube o en tu PC, y solo allí activa las herramientas. El teléfono es solo el escaparate.
Objetivo: crear un bot de Telegram propio, obtener el token (la contraseña del bot) y descubrir tu user ID para la whitelist. Son 3 conversaciones dentro del propio Telegram: no hay que instalar ningún programa.
/start
/newbot
<Nombre-de-tu-Jarvis> # ej.: Mi Jarvis
<usuario_do_bot>_bot # debe terminar en "_bot", ej.: meujarvis_bot
# @BotFather responde algo así — guarda esta línea:
# "Use this token to access the HTTP API:"
123456789:AAExxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxx # <-- ESTE es tu TELEGRAM_BOT_TOKEN
# 2) Descubre TU user ID: abre @userinfobot y envíale cualquier cosa.
# Responde "Id: 987654321" -> ese número es el tuyo <SEU_USER_ID>
# 3) En el archivo .env del agente (agentejax), completa:
TELEGRAM_BOT_TOKEN=<cole-o-token-do-passo-1>
TELEGRAM_WHITELIST=<SEU_USER_ID> # solo se atenderá este ID
Cómo verificar: con el agente en marcha, abre la conversación con tu bot y envía hola. Si responde, el token es correcto. Para probar la barrera, pídele a un amigo (que NO está en la lista blanca) que le escriba al bot: no debe recibir ninguna respuesta. Si tu «hola» no vuelve, comprueba que el token se haya copiado completo (sin espacios) y que el agente esté en funcionamiento.
Conceptos clave
El bot oficial de Telegram que crea bots y entrega el token.
La contraseña larga que identifica y autoriza a tu bot. Nunca la expongas.
El agente se conecta a Telegram; nada de puertos abiertos al mundo.
Lista de IDs autorizados; solo se atiende al dueño.
💬 WhatsApp (agentevoz)
En Brasil, el canal de mensajería dominante es WhatsApp. El proyecto de referencia para esto se llama agentevoz — un agente en Python que atiende por WhatsApp y fue pensado para brindar atención de verdad: recibe texto, imágenes e incluso audio, y decide en el momento cuál es la mejor forma de responder. El puente técnico entre tu agente y WhatsApp se llama Evolution API.
🔌 Evolution API: el adaptador de WhatsApp
WhatsApp no se diseñó originalmente para bots como Telegram. La Evolution API y un programa intermediario (un «puente») que conecta tu cuenta de WhatsApp con tu agente: recibe los mensajes entrantes y se los reenvía, y envía de vuelta las respuestas del agente. Lo conectas a tu número leyendo un código QR, parecido a WhatsApp Web.
En otras palabras: el agente no habla directamente con «WhatsApp»; se comunica con la Evolution API, y esta lo traduce para WhatsApp. Cambiar de canal es casi solo cambiar el adaptador.
La gran diferencia de agentevoz es el Policy Engine ("motor de reglas"): una capa que decide, mensaje por mensaje, como responder. Elige entre texto, voz o derivación a una persona, y también entre un modelo barato o un modelo premium. Así el asistente no gasta un modelo caro para responder «buen día» y sabe cuándo llamar a una persona de verdad.
✓ Lo que decide Policy Engine
- ✓Responder en texto (rápido y barato) o en voz.
- ✓Usar modelo barato para lo simple, premium para lo difícil.
- ✓Reconocer cuándo es mejor pasar a una persona.
- ✓Ahorro: gasta más solo cuando vale la pena.
✗ Sin un Policy Engine
- ✗Cada «hola» va al modelo más caro: factura inflada.
- ✗Siempre el mismo formato, incluso cuando la voz tendría más sentido.
- ✗El bot intenta resolverlo todo por su cuenta y se traba con lo que solo un humano puede resolver.
- ✗Ninguna regla clara para saber cuándo escalar o ahorrar.
¿Eres nuevo aquí? "Evolution API" es el programa puente que conecta WhatsApp con tu agente. "Policy Engine" es la capa de decisión que elige texto/voz/humano y un modelo barato/caro para cada mensaje. "Modelo" es el cerebro de IA (lo vimos en la Ruta 1). La voz en sí, con Whisper y TTS, es el tema del próximo módulo (5.2).
Conceptos clave
El puente que conecta tu cuenta de WhatsApp con el agente.
Decide entre texto, voz o una persona, y entre un modelo económico o premium, para cada mensaje.
El mismo cerebro atiende varios canales al mismo tiempo.
Cuando el bot reconoce que solo una persona puede resolverlo.
🖥️ ¿Dónde se ejecuta el agente?
Esta es la pregunta que más confunde a quienes llegan: si el celular es solo la puerta, ¿dónde se ejecuta realmente el asistente? La respuesta: el programa del agente —el código que piensa, recuerda y actúa— se ejecuta en una computadora que permanece encendida, y el celular solo se comunica con él. Tienes dos opciones principales de «hogar» para ese agente.
En la nube (ej.: Railway)
Subes el agente a un servicio que mantiene el programa encendido 24/7 por una pequeña tarifa mensual fija. No depende de que tu PC esté encendida; el asistente responde incluso mientras duermes. El Railway y un ejemplo popular: haces el deploy y te olvidas.
En tu PC de casa
El agente se ejecuta en tu propia computadora (o en una mini PC dedicada) encendida en casa. Costo de alojamiento cero, y los datos nunca salen de tu sala. La contrapartida: la PC debe permanecer encendida para que el asistente esté disponible.
📊 La regla mental
Separa siempre dos cosas que parecen una sola:
- •El canal (Telegram/WhatsApp) vive en el celular y es la puerta.
- •El agente (el programa que piensa) está en la nube O en tu PC — y es el motor.
- •Como el agente se ejecuta en una máquina siempre encendida, puede trabajar 24/7 — incluso cuando no miras el celular.
💡 Consejo práctico
Empieza en tu PC para aprender y probar gratis; cuando quieras disponibilidad total (responder de madrugada, enviar el resumen de las 7h por sí solo), migra a la nube. El código es casi el mismo: solo cambia dónde ejecutas el programa.
Conceptos clave
La puerta (celular) y el motor (servidor) son cosas separadas.
Aloja el agente 24/7 sin depender de que tu PC esté encendida.
Costo cero de alojamiento y datos que no salen de casa.
Cómo el agente vive en una máquina encendida y actúa todo el tiempo.
🔒 Privacidad en tu bolsillo
Aquí está lo más bonito de "Jarvis en el celular": tener al asistente en el bolsillo no significa entregar tus datos a cualquier nube. Como el canal (en el celular) y el cerebro (en el agente) están separados, puedes mantener el cerebro 100% local — funcionando en la computadora de casa — y dejar solo el canal en el teléfono mientras viajas.
La pieza que hace posible esto se llama Ollama: un programa que ejecuta modelos de IA en tu propia máquina, gratis, sin internet y sin enviar nada al exterior. Conversas por Telegram desde el celular; el mensaje llega al agente en tu PC; el agente consulta a un modelo que vive ahí mismo, en tu sala. Los datos van de tu celular a tu computadora y vuelven — nunca a OpenAI o Anthropic.
🏠 El cerebro se queda en casa, el acceso va en el bolsillo
Es lo mejor de ambos mundos: la comodidad de hablar desde el celular desde cualquier lugar, con la privacidad de un cerebro que nunca sale de tu casa.
- •Canal en el celular: el Telegram que ya usas.
- •Cerebro local: Ollama ejecutándose en la PC de casa, $0 por token.
- •Resultado: asistente en tu bolsillo, datos en tu sala.
Honestidad técnica: el mensaje todavía pasa por los servidores de Telegram/WhatsApp para llegar hasta ti — eso aplica a cualquier conversación en estas apps. La ventaja de privacidad aquí es que el razonamiento y la memoria del asistente ocurren en tu máquina, y no en el servidor de una empresa de IA. Para una confidencialidad total de extremo a extremo, el siguiente módulo (5.2) detalla el verdadero funcionamiento en el dispositivo.
Conceptos clave
El modelo se ejecuta en tu PC; los datos no salen de casa.
Programa que ejecuta modelos de IA localmente, gratis y sin conexión.
Permite tener un puerto en el celular e inteligencia en casa al mismo tiempo.
El modelo local no cobra por uso: explóralo todo lo que quieras.
🚧 Limitaciones de los asistentes nativos
"Pero mi celular ya tiene Siri (o Gemini, o Alexa). ¿Para qué todo este trabajo?" Buena pregunta. La diferencia está en una palabra: posesión. Siri y Gemini son asistentes nativos — cerrados, controlados por Apple y Google. No ves el código, no eliges el modelo, no defines la personalidad ni decides adónde van tus datos. Tu bot de Telegram/WhatsApp, en cambio, es tu.
✗ Asistente nativo (Siri / Gemini / Alexa)
- ✗Caja negra: no lees el código ni sabes qué hace por dentro.
- ✗Sin tu personalidad: no se puede reescribir quién es.
- ✗Datos en la empresa: lo que dices va a sus servidores.
- ✗Herramientas limitadas: solo hace lo que el fabricante permitió.
✓ Tu bot de Telegram / WhatsApp
- ✓Abierto: ves, entiendes y cambias cada parte del código.
- ✓Tu persona: define su tono, sus valores y su forma de ser (el alma, en SOUL.md).
- ✓Cerebro a tu elección: nube o local, tú decides dónde viven los datos.
- ✓Herramientas abiertas: conecta la agenda, el correo electrónico o lo que quieras, mediante MCP.
⚠️ El punto del que nadie habla
Con un asistente nativo, si la empresa cambia de opinión, desactiva una función o aumenta el precio, el problema es tuyo y no puedes hacer nada. Con tu bot, tú eres dueño de la regla. Cómodo no es lo mismo que libre, y la propuesta de esta ruta es un asistente cómodo e libre.
Conceptos clave
Siri/Gemini/Alexa: cerrados y controlados por el fabricante.
No ves ni controlas lo que ocurre por dentro.
Tu bot es tuyo: código, persona, datos y herramientas.
Puedes tener ambas cosas: un asistente fácil de usar y realmente tuyo.
Autoevaluación (opcional): en el "Jarvis de bolsillo", ¿dónde funciona realmente el agente?
🎯 Resumen del módulo
Siguiente módulo:
5.2 — Voz y on-device: hablar, escuchar y ejecutar en local