PTENES
MÓDULO 3.5

💰 Presupuesto y tokens · 73% es sobrecarga fija

El secreto sucio de los agentes: ~73% de cada request es sobrecarga fija — system prompt, herramientas, memoria. Solo ~27% es tu pregunta. Entender esto cambia cómo operas y evita que quemes 4 millones de tokens sin darte cuenta.

6
Temas
~25
Minutos
Avanzado
Nivel
Práctica
Tipo
1

🥧 73% de overhead fijo

Cuando haces una pregunta de una línea, el modelo no lee solo esa pregunta. Lee todo el overhead primero: el system prompt, la lista de herramientas, la memoria, las skills cargadas. Este fragmento fijo es cerca de 73% de cada request — y pagas por él en cada llamada, sin importar el tamaño de la pregunta.

73% overhead fijo 27% útil Overhead fijo: system prompt, tools, memoria, skills Útil: tu pregunta real → Cada llamada paga el peaje del 73%

Diagrama ilustrativo · proporción aproximada de overhead × contenido útil

2

🔤 Tokens ↔ palabras

Para tener una idea del costo, necesitas convertir. La cuenta rápida: ~10 tokens equivalen a unas 7 palabras (≈70-75%). Un token es una parte de una palabra: las palabras comunes son 1 token; las palabras largas se convierten en 2 o 3.

Conversión rápida (ilustrativo)

10 tokens ≈ 7 palabras
100 tokens ≈ ~70 palabras (un párrafo corto)
1.000 tokens ≈ ~700 palabras (una página)

📊 Por qué es importante estimar

Antes de pegar un documento de 50 páginas, ya sabes: son ~35.000 tokens solo de entrada, y eso entra en todas las llamadas siguientes si no limpias la sesión.

3

🧹 Estrategias de ahorro

La buena noticia: pequeños hábitos reducen la cuenta a la mitad. El secreto es mantener el overhead al mínimo y la sesión limpia.

✓ Qué HACER

  • ✓Limpiar la sesión con frecuencia (una conversación, una meta).
  • ✓Usar el modelo adecuado para cada job.
  • ✓Mantener breves los system prompts.
  • ✓Comprimir cuando el contexto crezca (de grande a pequeño).

✗ Qué EVITAR

  • ✗Cargar decenas de skills que no usas.
  • ✗System prompts gigantes "por si acaso".
  • ✗Mantener una sesión infinita acumulando contexto.
  • ✗Usar un modelo caro para una tarea trivial.

💡 Consejo práctico

Lema del material: una conversación, una meta; siempre limpiar y empezar de nuevo. Cada skill inútil cargada en el overhead se paga en cada mensaje de la sesión.

4

🔥 4 millones de tokens en 2h

La advertencia real del material: alguien quemó 4 millones de tokens en 2 horas de uso aparentemente ligero. Otro gastó 21.000 tokens solo preguntando la hora por un error en bucle. Con una clave de API, el dinero se va rápido si no lo vigilas.

!

4M tokens en 2h de uso ligero

Contexto que crece sin limpieza + crons que se ejecutan + overhead fijo = explosión silenciosa del consumo.

!

21.000 tokens para saber la hora

Un error puso al agente en un ciclo de intentos: cada retry volvía a cobrar el 73% de overhead.

🚨 Atención

Un bucle descontrolado es el mayor villano de la factura. Monitorea el uso y usa /stop cuando algo parezca atascado repitiendo lo mismo.

5

🎛️ Modelo correcto, costo correcto

La mayor palanca para reducir costos es el modelo. Sé específico: el razonamiento complejo va en el modelo caro (Opus); el volumen y las tareas simples van en el barato o en el gratuito (DeepSeek, GPT vía OAuth). Usar Opus para todo multiplica el costo sin mejorar la calidad.

Razonamiento

Modelo costoso, solo donde vale la pena.

Volumen

Modelo económico o por suscripción.

Rutina / piloto automático

Modelo gratuito, casi gratis.

6

📊 Límites de gasto

La red de seguridad definitiva: define un límite de gasto. En OpenRouter, por ejemplo, configuras un límite (ej.: US$10/mes) y el sistema simplemente se detiene al alcanzarlo. Eso te permite dormir tranquilo incluso con crons en ejecución.

Panel de uso · recreación ilustrativa, no es una captura de pantalla real

Gasto del mesUS$ 7,40 / 10,00
Alerta en80%
73% fijo

Cada llamada es de pago.

Limpiar sesión

Una conversación, una meta.

Modelo adecuado

Caro solo donde vale la pena.

Límite

Se detiene en el límite.

7

🧾 Dónde se fuga el dinero (lista de verificación)

En conjunto: las mayores fugas de tokens son predecibles. Repasa mentalmente esta lista cada vez que la factura te asuste.

1

Sesión infinita

El contexto acumulado se incluye en cada llamada. Limpia y empieza de nuevo.

2

Modelo costoso en una tarea trivial

Usar Opus para "qué hora es" es un desperdicio. Cámbialo por /model.

3

Crons olvidados

Una programación frecuente multiplica el overhead. Revisa los crons.

4

Bucle de reintentos

Un error en bucle vuelve a cobrar el 73% en cada intento. Usa /stop.

💡 Consejo práctico

Deja abierto el panel de uso durante las primeras semanas. Ver cómo sube el número en tiempo real es la mejor lección sobre economía de tokens.

📌 Resumen del módulo

✓
73% de sobrecarga - cada request paga un costo fijo de system prompt, tools y memoria.
✓
10 tokens ≈ 7 palabras - estima antes de enviar un texto enorme.
✓
Limpia y enfócate - una conversación, una meta; nada de skills inútiles.
✓
El bucle = el villano - 4M tokens en 2h y 21k para ver el tiempo vinieron de loops y de un contexto inflado.
✓
Límite de gasto - define un límite y el sistema se detiene solo.

Próximo módulo:

3.6 - 🌐 Operating System: el panel único donde gestionas personas, memoria, gastos y metas.