📱 Jarvis en el celular
Tu asistente en el bolsillo, sin descargar una app de tienda: vive dentro de una app de mensajería que ya usas (Telegram o WhatsApp). Aquí verás los canales del teléfono, cómo escucha y habla (voz), qué significa ejecutarlo localmente de verdad, y armarás paso a paso tu Jarvis de bolsillo.
Lee de izquierda a derecha: el celular y es solo el canal (una app de mensajería). El cerebro funciona en la nube o en tu PC y tiene acceso a voz, memoria y herramientas, lo que da como resultado un asistente 24/7 en tu bolsillo, sin instalar ninguna app de la tienda.
Mapa de la ruta
Contenido detallado
📲 Dónde vive Jarvis en el celular (los canales)
El cambio: no instalas una app de tienda. Usas Telegram o WhatsApp, que ya funciona en tu teléfono, como puerta de entrada a un agente que vive en la nube o en tu PC: 24/7, privado y tuyo.
No necesitas publicar una app en App Store ni en Play Store. Tu Jarvis vive dentro de una app de mensajería que ya tienes instalada — y conversas con él como lo harías con un contacto.
Es el atajo que hace posible hoy tener un «asistente en el bolsillo», sin convertirte en desarrollador de aplicaciones, sin aprobación de una tienda y sin costo de publicación.
«Telegram ya es móvil», app de mensajería como canal, cero app nativa.
En Telegram, hablas con el @BotFather (un bot oficial), te da un token (la contraseña de tu bot), y pones tu ID de usuario en una lista de permitidos — la lista de a quién atiende el bot. El proyecto de referencia se llama agentejax.
Es el camino preferido: solo un token, ningún servidor web expuesto (usa long-polling), gratis y accesible desde cualquier dispositivo donde tengas Telegram.
@BotFather, token, whitelist (user ID), long-polling.
En WhatsApp, la conexión suele pasar por Evolution API (un puente que conecta tu número con el agente). Un Policy Engine (motor de reglas) decide si responde por texto, por voz o si se lo pasa a una persona. El proyecto de referencia se llama agentevoz.
WhatsApp es donde ya está la mayoría de las personas: ideal para atención multicanal, con texto, imagen y audio en el mismo lugar.
Evolution API, Policy Engine, multicanal, decisión texto/voz/humano.
El celular es solo el canal; el cerebro se ejecuta en otro lugar. Puede estar en una plataforma en la nube (p. ej., Railway) o en tu propia computadora en casa, encendida las 24 horas.
Separar el «canal» del «cerebro» es la idea central: sales de casa con el teléfono, pero el agente sigue trabajando 24/7 donde lo alojaste.
Canal ≠ cerebro, alojamiento (Railway/PC), ejecución 24/7.
Puedes mantener el cerebro 100% local: un modelo que se ejecuta mediante Ollama en la PC de casa y usar solo el canal en el celular. Tus conversaciones se procesan en tu máquina, no en una nube de terceros.
Es lo mejor de ambos mundos: la comodidad del celular con la privacidad de lo local; tú eliges dónde quedan los datos.
Ollama local, local-first, cerebro en casa + canal en el bolsillo.
Los asistentes que ya vienen en el teléfono (Siri, Gemini, Alexa) son cajas negras: no controlas la memoria, la personalidad, las herramientas ni dónde terminan los datos.
Te muestra lo que ganas al usar tu propio bot: el control total. El bot de Telegram/WhatsApp es TUYO; tú defines todo.
Asistente cerrado, caja negra, control/propiedad de tu bot.
🎙️ Voz y on-device: hablar, escuchar y ejecutarse localmente
Cómo escucha Jarvis (STT), cómo habla (TTS) y por qué la voz es solo una interfaz, no el cerebro. Además: qué significa ejecutarlo «realmente en el dispositivo» con Ollama y hasta dónde llega el tiempo real.
La voz es solo la forma de entrar y salir: el audio se convierte en texto al entrar y el texto se convierte en audio al salir. Quien piensa es el orquestador (el agente). "La voz es interfaz, el orquestador es el cerebro; hablar es una salida opcional que se decide en el momento."
Evita el error común de pensar que la "voz" es una IA diferente. Es el mismo cerebro de siempre, solo que con un micrófono y un altavoz conectados.
Interfaz vs. cerebro, orquestador, salida opcional en tiempo de ejecución.
STT = Speech-to-Text (voz a texto). Telegram entrega el audio como archivo .ogg; o ffmpeg convierte el formato; y el Whisper (modelo de transcripción) escribe lo que dijiste, en portugués.
Es el primer paso de cualquier función de voz. Presta atención a un detalle práctico: Whisper suele usar una clave de OpenAI, que es distinta de la clave de Anthropic.
STT, ffmpeg, Whisper, .ogg, clave de OpenAI ≠ Anthropic.
TTS = Text-to-Speech (texto a voz). Un modelo de voz (p. ej., tts-1 con la voz "nova", o un TTS que se ejecuta localmente) toma la respuesta en texto y genera el audio que Jarvis "dice" de vuelta.
Es lo que cierra el ciclo de la conversación por voz: tú hablas, entiende, piensa y responde hablando.
TTS, modelo de voz, voz en la nube o local.
O Policy Engine decide, con cada respuesta, si muestra texto, usa voz o llama a una persona; también si usa un modelo económico o uno premium, según la dificultad de la tarea.
Es lo que permite ahorrar: la voz y los modelos premium cuestan más; usarlos solo cuando vale la pena mantiene baja la cuenta sin perder calidad donde importa.
Policy Engine, decisión por respuesta, económico vs. premium.
En el dispositivo = ejecutar el modelo en el propio dispositivo/PC, sin nube. Vía Ollama, el modelo adecuado depende de tu RAM (p. ej., ~3B con 8 GB, ~8B con 16 GB). En una CPU sin GPU, la respuesta es lenta (30-60s); una GPU o la nube la aceleran.
Ajusta las expectativas: «local» es real y privado, pero tiene un costo en velocidad. Saberlo evita frustraciones y ayuda a elegir el modelo adecuado.
En el dispositivo, Ollama, modelo según la RAM (3B/8B), CPU vs GPU, latencia.
La hoja de ruta de la voz va del texto (v1) a la voz asíncrona (v2, Whisper + TTS) y luego a la llamada telefónica en tiempo real (v3), con servicios como Twilio o LiveKit y latencia inferior a 1,5 segundo.
Muestra el límite de lo posible — y que conversar "en vivo" por teléfono con Jarvis es avanzado, no el punto de partida. Ajusta tus expectativas.
Tiempo real, Twilio/LiveKit, latencia <1,5s, roadmap v1→v3.
🛠️ Arma tu Jarvis de bolsillo (proyecto)
El proyecto guiado de principio a fin: desde el bot de Telegram hasta la voz y la cadencia. Cinco pasos para pasar de «nada» a un asistente personal con memoria y una skill útil, accesible desde el celular.
El objetivo: un bot personal de Telegram, con memoria y una skill útil, al que accedes desde el celular. Construido en 5 pasos, ladrillo por ladrillo ("brick-by-brick").
Tener el panorama completo antes de empezar evita que te pierdas a mitad de camino y muestra cómo las piezas de las rutas anteriores encajan en un producto real.
Alcance del proyecto, brick-by-brick, repaso de las piezas (canal/cerebro/memoria/skill).
Crear el bot en @BotFather, copiar el token y añadir tu user ID a la whitelist: exactamente lo que viste en el módulo 5.1, ahora en la práctica.
Es el «Level 1 / Foundation»: sin el canal en pie, no hay nada que probar. Todo lo demás se apoya en este primer bloque.
@BotFather, token, whitelist, Foundation (Level 1).
Elegir el modelo que piensa: nube (potente, pagas por uso) o Ollama local (gratis, privado). La elección está en un archivo .env, sin tocar el código.
Es aquí donde el bot deja de ser un «eco» y empieza a responder de verdad. Y cambiar el cerebro después es solo editar una línea.
Cerebro (modelo LLM), nube vs. Ollama, hot-swap por .env.
Agrega un soul.md (la personalidad: nombre, tono, valores) es una base de datos SQLite para guardar la conversación. A partir de aquí, recuerda quién eres y lo que ya se dijo.
Es el salto de «desconocido que responde» a «asistente que te conoce»: la memoria es lo que crea continuidad entre las conversaciones.
soul.md, memoria persistente, SQLite, Memory (Level 2).
Conectar una skill (una receta empaquetada) que hace algo concreto; por ejemplo, "resumen de mi día" consultando la agenda mediante MCP (el «USB» de las herramientas de IA).
Es cuando el bot deja de solo conversar y empieza a hacer algo útil para ti: la primera capacidad real de tu Jarvis de bolsillo.
Skill, MCP, herramienta (agenda), Tools/MCP (Level 4).
Conectar la voz (mensaje de audio mediante Whisper/TTS, del módulo 5.2) y la cadencia: un heartbeat que se activa solo; por ejemplo, un resumen todos los días a las 7h. Después, cómo probar todo de principio a fin.
Cierra el proyecto: Jarvis deja de solo reaccionar y pasa a actuar por su cuenta en el momento adecuado — y confirmas que cada bloque funciona.
Voz (Whisper/TTS), cadencia, heartbeat/cron, prueba de extremo a extremo.