PTENES
RUTA 5

📱 Jarvis en el celular

Tu asistente en el bolsillo, sin descargar una app de tienda: vive dentro de una app de mensajería que ya usas (Telegram o WhatsApp). Aquí verás los canales del teléfono, cómo escucha y habla (voz), qué significa ejecutarlo localmente de verdad, y armarás paso a paso tu Jarvis de bolsillo.

Telegram tu celular solo el canal Agente (cerebro) nube (Railway) o tu PC voz (escuchar/hablar) memoria + soul herramientas / skill 24/7 en el bolsillo sin app de tienda

Lee de izquierda a derecha: el celular y es solo el canal (una app de mensajería). El cerebro funciona en la nube o en tu PC y tiene acceso a voz, memoria y herramientas, lo que da como resultado un asistente 24/7 en tu bolsillo, sin instalar ninguna app de la tienda.

3
Módulos
18
Temas
~2h30
Duración
Intermedio
Nivel
Progreso de la ruta0%
0 de 18 temas

Mapa de la ruta

Contenido detallado

5.1~50 min

📲 Dónde vive Jarvis en el celular (los canales)

El cambio: no instalas una app de tienda. Usas Telegram o WhatsApp, que ya funciona en tu teléfono, como puerta de entrada a un agente que vive en la nube o en tu PC: 24/7, privado y tuyo.

0 de 6 · 0%
Qué es:

No necesitas publicar una app en App Store ni en Play Store. Tu Jarvis vive dentro de una app de mensajería que ya tienes instalada — y conversas con él como lo harías con un contacto.

Por qué aprender:

Es el atajo que hace posible hoy tener un «asistente en el bolsillo», sin convertirte en desarrollador de aplicaciones, sin aprobación de una tienda y sin costo de publicación.

Conceptos clave:

«Telegram ya es móvil», app de mensajería como canal, cero app nativa.

Qué es:

En Telegram, hablas con el @BotFather (un bot oficial), te da un token (la contraseña de tu bot), y pones tu ID de usuario en una lista de permitidos — la lista de a quién atiende el bot. El proyecto de referencia se llama agentejax.

Por qué aprender:

Es el camino preferido: solo un token, ningún servidor web expuesto (usa long-polling), gratis y accesible desde cualquier dispositivo donde tengas Telegram.

Conceptos clave:

@BotFather, token, whitelist (user ID), long-polling.

Qué es:

En WhatsApp, la conexión suele pasar por Evolution API (un puente que conecta tu número con el agente). Un Policy Engine (motor de reglas) decide si responde por texto, por voz o si se lo pasa a una persona. El proyecto de referencia se llama agentevoz.

Por qué aprender:

WhatsApp es donde ya está la mayoría de las personas: ideal para atención multicanal, con texto, imagen y audio en el mismo lugar.

Conceptos clave:

Evolution API, Policy Engine, multicanal, decisión texto/voz/humano.

Qué es:

El celular es solo el canal; el cerebro se ejecuta en otro lugar. Puede estar en una plataforma en la nube (p. ej., Railway) o en tu propia computadora en casa, encendida las 24 horas.

Por qué aprender:

Separar el «canal» del «cerebro» es la idea central: sales de casa con el teléfono, pero el agente sigue trabajando 24/7 donde lo alojaste.

Conceptos clave:

Canal ≠ cerebro, alojamiento (Railway/PC), ejecución 24/7.

Qué es:

Puedes mantener el cerebro 100% local: un modelo que se ejecuta mediante Ollama en la PC de casa y usar solo el canal en el celular. Tus conversaciones se procesan en tu máquina, no en una nube de terceros.

Por qué aprender:

Es lo mejor de ambos mundos: la comodidad del celular con la privacidad de lo local; tú eliges dónde quedan los datos.

Conceptos clave:

Ollama local, local-first, cerebro en casa + canal en el bolsillo.

Qué es:

Los asistentes que ya vienen en el teléfono (Siri, Gemini, Alexa) son cajas negras: no controlas la memoria, la personalidad, las herramientas ni dónde terminan los datos.

Por qué aprender:

Te muestra lo que ganas al usar tu propio bot: el control total. El bot de Telegram/WhatsApp es TUYO; tú defines todo.

Conceptos clave:

Asistente cerrado, caja negra, control/propiedad de tu bot.

Ver completo
5.2~50 min

🎙️ Voz y on-device: hablar, escuchar y ejecutarse localmente

Cómo escucha Jarvis (STT), cómo habla (TTS) y por qué la voz es solo una interfaz, no el cerebro. Además: qué significa ejecutarlo «realmente en el dispositivo» con Ollama y hasta dónde llega el tiempo real.

0 de 6 · 0%
Qué es:

La voz es solo la forma de entrar y salir: el audio se convierte en texto al entrar y el texto se convierte en audio al salir. Quien piensa es el orquestador (el agente). "La voz es interfaz, el orquestador es el cerebro; hablar es una salida opcional que se decide en el momento."

Por qué aprender:

Evita el error común de pensar que la "voz" es una IA diferente. Es el mismo cerebro de siempre, solo que con un micrófono y un altavoz conectados.

Conceptos clave:

Interfaz vs. cerebro, orquestador, salida opcional en tiempo de ejecución.

Qué es:

STT = Speech-to-Text (voz a texto). Telegram entrega el audio como archivo .ogg; o ffmpeg convierte el formato; y el Whisper (modelo de transcripción) escribe lo que dijiste, en portugués.

Por qué aprender:

Es el primer paso de cualquier función de voz. Presta atención a un detalle práctico: Whisper suele usar una clave de OpenAI, que es distinta de la clave de Anthropic.

Conceptos clave:

STT, ffmpeg, Whisper, .ogg, clave de OpenAI ≠ Anthropic.

Qué es:

TTS = Text-to-Speech (texto a voz). Un modelo de voz (p. ej., tts-1 con la voz "nova", o un TTS que se ejecuta localmente) toma la respuesta en texto y genera el audio que Jarvis "dice" de vuelta.

Por qué aprender:

Es lo que cierra el ciclo de la conversación por voz: tú hablas, entiende, piensa y responde hablando.

Conceptos clave:

TTS, modelo de voz, voz en la nube o local.

Qué es:

O Policy Engine decide, con cada respuesta, si muestra texto, usa voz o llama a una persona; también si usa un modelo económico o uno premium, según la dificultad de la tarea.

Por qué aprender:

Es lo que permite ahorrar: la voz y los modelos premium cuestan más; usarlos solo cuando vale la pena mantiene baja la cuenta sin perder calidad donde importa.

Conceptos clave:

Policy Engine, decisión por respuesta, económico vs. premium.

Qué es:

En el dispositivo = ejecutar el modelo en el propio dispositivo/PC, sin nube. Vía Ollama, el modelo adecuado depende de tu RAM (p. ej., ~3B con 8 GB, ~8B con 16 GB). En una CPU sin GPU, la respuesta es lenta (30-60s); una GPU o la nube la aceleran.

Por qué aprender:

Ajusta las expectativas: «local» es real y privado, pero tiene un costo en velocidad. Saberlo evita frustraciones y ayuda a elegir el modelo adecuado.

Conceptos clave:

En el dispositivo, Ollama, modelo según la RAM (3B/8B), CPU vs GPU, latencia.

Qué es:

La hoja de ruta de la voz va del texto (v1) a la voz asíncrona (v2, Whisper + TTS) y luego a la llamada telefónica en tiempo real (v3), con servicios como Twilio o LiveKit y latencia inferior a 1,5 segundo.

Por qué aprender:

Muestra el límite de lo posible — y que conversar "en vivo" por teléfono con Jarvis es avanzado, no el punto de partida. Ajusta tus expectativas.

Conceptos clave:

Tiempo real, Twilio/LiveKit, latencia <1,5s, roadmap v1→v3.

Ver completo
5.3~50 min

🛠️ Arma tu Jarvis de bolsillo (proyecto)

El proyecto guiado de principio a fin: desde el bot de Telegram hasta la voz y la cadencia. Cinco pasos para pasar de «nada» a un asistente personal con memoria y una skill útil, accesible desde el celular.

0 de 6 · 0%
Qué es:

El objetivo: un bot personal de Telegram, con memoria y una skill útil, al que accedes desde el celular. Construido en 5 pasos, ladrillo por ladrillo ("brick-by-brick").

Por qué aprender:

Tener el panorama completo antes de empezar evita que te pierdas a mitad de camino y muestra cómo las piezas de las rutas anteriores encajan en un producto real.

Conceptos clave:

Alcance del proyecto, brick-by-brick, repaso de las piezas (canal/cerebro/memoria/skill).

Qué es:

Crear el bot en @BotFather, copiar el token y añadir tu user ID a la whitelist: exactamente lo que viste en el módulo 5.1, ahora en la práctica.

Por qué aprender:

Es el «Level 1 / Foundation»: sin el canal en pie, no hay nada que probar. Todo lo demás se apoya en este primer bloque.

Conceptos clave:

@BotFather, token, whitelist, Foundation (Level 1).

Qué es:

Elegir el modelo que piensa: nube (potente, pagas por uso) o Ollama local (gratis, privado). La elección está en un archivo .env, sin tocar el código.

Por qué aprender:

Es aquí donde el bot deja de ser un «eco» y empieza a responder de verdad. Y cambiar el cerebro después es solo editar una línea.

Conceptos clave:

Cerebro (modelo LLM), nube vs. Ollama, hot-swap por .env.

Qué es:

Agrega un soul.md (la personalidad: nombre, tono, valores) es una base de datos SQLite para guardar la conversación. A partir de aquí, recuerda quién eres y lo que ya se dijo.

Por qué aprender:

Es el salto de «desconocido que responde» a «asistente que te conoce»: la memoria es lo que crea continuidad entre las conversaciones.

Conceptos clave:

soul.md, memoria persistente, SQLite, Memory (Level 2).

Qué es:

Conectar una skill (una receta empaquetada) que hace algo concreto; por ejemplo, "resumen de mi día" consultando la agenda mediante MCP (el «USB» de las herramientas de IA).

Por qué aprender:

Es cuando el bot deja de solo conversar y empieza a hacer algo útil para ti: la primera capacidad real de tu Jarvis de bolsillo.

Conceptos clave:

Skill, MCP, herramienta (agenda), Tools/MCP (Level 4).

Qué es:

Conectar la voz (mensaje de audio mediante Whisper/TTS, del módulo 5.2) y la cadencia: un heartbeat que se activa solo; por ejemplo, un resumen todos los días a las 7h. Después, cómo probar todo de principio a fin.

Por qué aprender:

Cierra el proyecto: Jarvis deja de solo reaccionar y pasa a actuar por su cuenta en el momento adecuado — y confirmas que cada bloque funciona.

Conceptos clave:

Voz (Whisper/TTS), cadencia, heartbeat/cron, prueba de extremo a extremo.

Ver completo