🥧 73% de overhead fijo
Cuando haces una pregunta de una línea, el modelo no lee solo esa pregunta. Lee todo el overhead primero: el system prompt, la lista de herramientas, la memoria, las skills cargadas. Este fragmento fijo es cerca de 73% de cada request — y pagas por él en cada llamada, sin importar el tamaño de la pregunta.
Diagrama ilustrativo · proporción aproximada de overhead × contenido útil
🔤 Tokens ↔ palabras
Para tener una idea del costo, necesitas convertir. La cuenta rápida: ~10 tokens equivalen a unas 7 palabras (≈70-75%). Un token es una parte de una palabra: las palabras comunes son 1 token; las palabras largas se convierten en 2 o 3.
Conversión rápida (ilustrativo)
📊 Por qué es importante estimar
Antes de pegar un documento de 50 páginas, ya sabes: son ~35.000 tokens solo de entrada, y eso entra en todas las llamadas siguientes si no limpias la sesión.
🧹 Estrategias de ahorro
La buena noticia: pequeños hábitos reducen la cuenta a la mitad. El secreto es mantener el overhead al mínimo y la sesión limpia.
✓ Qué HACER
- ✓Limpiar la sesión con frecuencia (una conversación, una meta).
- ✓Usar el modelo adecuado para cada job.
- ✓Mantener breves los system prompts.
- ✓Comprimir cuando el contexto crezca (de grande a pequeño).
✗ Qué EVITAR
- ✗Cargar decenas de skills que no usas.
- ✗System prompts gigantes "por si acaso".
- ✗Mantener una sesión infinita acumulando contexto.
- ✗Usar un modelo caro para una tarea trivial.
💡 Consejo práctico
Lema del material: una conversación, una meta; siempre limpiar y empezar de nuevo. Cada skill inútil cargada en el overhead se paga en cada mensaje de la sesión.
🔥 4 millones de tokens en 2h
La advertencia real del material: alguien quemó 4 millones de tokens en 2 horas de uso aparentemente ligero. Otro gastó 21.000 tokens solo preguntando la hora por un error en bucle. Con una clave de API, el dinero se va rápido si no lo vigilas.
4M tokens en 2h de uso ligero
Contexto que crece sin limpieza + crons que se ejecutan + overhead fijo = explosión silenciosa del consumo.
21.000 tokens para saber la hora
Un error puso al agente en un ciclo de intentos: cada retry volvía a cobrar el 73% de overhead.
🚨 Atención
Un bucle descontrolado es el mayor villano de la factura. Monitorea el uso y usa /stop cuando algo parezca atascado repitiendo lo mismo.
🎛️ Modelo correcto, costo correcto
La mayor palanca para reducir costos es el modelo. Sé específico: el razonamiento complejo va en el modelo caro (Opus); el volumen y las tareas simples van en el barato o en el gratuito (DeepSeek, GPT vía OAuth). Usar Opus para todo multiplica el costo sin mejorar la calidad.
Modelo costoso, solo donde vale la pena.
Modelo económico o por suscripción.
Modelo gratuito, casi gratis.
📊 Límites de gasto
La red de seguridad definitiva: define un límite de gasto. En OpenRouter, por ejemplo, configuras un límite (ej.: US$10/mes) y el sistema simplemente se detiene al alcanzarlo. Eso te permite dormir tranquilo incluso con crons en ejecución.
Panel de uso · recreación ilustrativa, no es una captura de pantalla real
Cada llamada es de pago.
Una conversación, una meta.
Caro solo donde vale la pena.
Se detiene en el límite.
🧾 Dónde se fuga el dinero (lista de verificación)
En conjunto: las mayores fugas de tokens son predecibles. Repasa mentalmente esta lista cada vez que la factura te asuste.
Sesión infinita
El contexto acumulado se incluye en cada llamada. Limpia y empieza de nuevo.
Modelo costoso en una tarea trivial
Usar Opus para "qué hora es" es un desperdicio. Cámbialo por /model.
Crons olvidados
Una programación frecuente multiplica el overhead. Revisa los crons.
Bucle de reintentos
Un error en bucle vuelve a cobrar el 73% en cada intento. Usa /stop.
💡 Consejo práctico
Deja abierto el panel de uso durante las primeras semanas. Ver cómo sube el número en tiempo real es la mejor lección sobre economía de tokens.
📌 Resumen del módulo
Próximo módulo:
3.6 - 🌐 Operating System: el panel único donde gestionas personas, memoria, gastos y metas.