Tu comodidad de lectura
MÓDULO 2.2

Router, contexto y procesamiento

Evita encaminar una entrada al modelo equivocado.

6 temas 35–50 min con práctica Motor local Ejercicios comentados
Idioma Punto de control Límite de tokens LAYA / INEMA · flujo conceptual
Tu progreso
Tu progreso
  1. El Router elige antes de predecir
  2. El portugués necesita una elección explícita en el laboratorio
  3. El presupuesto de tokens se comparte
  4. Muchas clases compiten por el mismo espacio
  5. Modelo residente y alternancia de idioma
  6. Batching y latencia percibida
1

El Router elige antes de predecir

Qué es

Router.route puede seleccionar un checkpoint sin ejecutar la red neuronal. La decisión usa una indicación explícita de modelo o tarea, configuración opcional de workflow, idioma informado y detección de escritura o idioma. Esto evita usar solo la confianza posterior como defensa contra un modelo que no entiende el texto.

Por qué aprender

El código actual debe prevalecer sobre diagramas simplificados. typed-decisions no se selecciona automáticamente por defecto. Activar auto_task_detection hace correspondencia exacta de los identificadores de cuatro workflows; esto no es un entendimiento universal del dominio.

Ejemplo aplicado

Router().route({"message":"Cobranza duplicada"}, questions, lang="pt") elige multilingual.

✓ Aplicar con criterio

No. La detección opcional exige el conjunto exacto de identificadores de un workflow y viene deshabilitada por defecto.

✗ Evitar la conclusión automática

¿Un campo urgency es suficiente para seleccionar typed-decisions?

No aceptes una respuesta solo por el nombre del campo o por cómo se ve la precisión. Revisa la definición y el contexto de esta sección.

Conceptos clave

Enrutamiento

selección previa

Override

indicación explícita

Script

sistema de escritura

Workflow

esquema especializado

Prueba tu comprensión

¿Un campo urgency es suficiente para seleccionar typed-decisions?

Revisar respuesta comentada

No. La detección opcional exige el conjunto exacto de identificadores de un workflow y viene deshabilitada por defecto.

2

El portugués necesita una elección explícita en el laboratorio

Qué es

El portugués usa alfabeto latino, como el inglés, y los mensajes muy cortos ofrecen poca evidencia para la detección automática. Como el contrato de este laboratorio ya declara atención en portugués, la implementación fija multilingual. El SDK sigue disponible para quien quiera experimentar enrutamiento dinámico en otro flujo.

Por qué aprender

Una regla simple basada en información confiable del producto puede superar una heurística de idioma. Si la interfaz sabe que la cola es brasileña, no necesita adivinarlo en cada ticket. Pruebe por separado abreviaciones, errores tipográficos y mensajes mezclados.

Ejemplo aplicado

Hola contiene poca información; la cola de atención define el checkpoint, no la confianza de una predicción posterior.

  1. 1
    Observa

    Hola contiene poca información; la cola de atención define el checkpoint, no la confianza de una predicción posterior.

  2. 2
    Define

    Portugués usa alfabeto latino, como inglés, y los mensajes muy cortos ofrecen poca evidencia para la detección automática.

  3. 3
    Revisa

    No. La cobertura declarada de idiomas no garantiza desempeño en el vocabulario, los productos y las expresiones de sus clientes.

Conceptos clave

Idioma conocido

metadato confiable

Texto corto

poca evidencia

Heurística

aproximación

Contrato lingüístico

alcance

Prueba tu comprensión

¿El modelo multilingüe prescinde de pruebas en portugués?

Revisar respuesta comentada

No. La cobertura declarada de idiomas no garantiza desempeño en el vocabulario, los productos y las expresiones de sus clientes.

3

El presupuesto de tokens se comparte

Qué es

El prompt interno reserva espacio para la pregunta y las opciones; el resto acomoda el estado. El checkpoint multilingual suele usar max_len 1024 y head_max_len 256. Esos números no equivalen a caracteres ni aseguran que cualquier documento con menos de 1024 palabras quepa.

Por qué aprender

El SDK puede truncar el estado. En la adaptación, calculamos el espacio disponible para cada pregunta y rechazamos entradas que perderían tokens. Cortar el final de un mensaje puede eliminar justamente la negación, la fecha o el pedido principal.

Ejemplo aplicado

Un historial largo termina con ya recibí el reembolso. Si ese fragmento se recorta, la decisión puede representar una situación ya superada.

Comando / esquema de referencia

from laya import Router
from practical.engine import QUESTIONS
router = Router(max_loaded=1)
router.preload(["multilingual"])
result = router.predict(
    {"message": "Fui cobrado duas vezes."},
    QUESTIONS, model="multilingual", lang="pt")

Conceptos clave

Token

unidad del tokenizer

Encabezado

pregunta y opciones

Estado

contenido del ticket

Truncamiento

pérdida de entrada

Prueba tu comprensión

¿Por qué el límite de la interfaz en caracteres no basta?

Revisar respuesta comentada

La relación entre caracteres y tokens varía. La protección definitiva usa el tokenizer real y el menor espacio disponible entre las cuatro preguntas.

4

Muchas clases compiten por el mismo espacio

Qué es

Cada alternativa necesita tener marcadores y texto suficiente para seguir siendo distinguible. Decenas de opciones consumen el presupuesto del encabezado. En clasificaciones grandes, etiquetas parecidas pueden quedar casi idénticas después de recortes. El informe del proyecto usa Banking77 para mostrar ese límite.

Por qué aprender

Una alternativa es la jerarquía: primero elija una familia y luego una subcategoría. Esto reduce opciones por etapa, pero los errores de la primera elección se propagan. Compare el conjunto completo y mantenga un camino de revisión para casos entre familias.

Ejemplo aplicado

Primero financiero versus técnico; luego cobranza duplicada versus nota fiscal, dentro de la familia elegida.

✓ Aplicar con criterio

No. Puede reducir el espacio del estado y aumentar el costo; aun así es necesario medir calidad, memoria y latencia con las nuevas configuraciones.

✗ Evitar la conclusión automática

¿Aumentar head_max_len resuelve cualquier número de categorías?

No aceptes una respuesta solo por el nombre del campo o por cómo se ve la precisión. Revisa la definición y el contexto de esta sección.

Conceptos clave

Cardinalidad

número de clases

Jerarquía

etapas de selección

Propagación

error encadenado

Descripción

señal discriminativa

Prueba tu comprensión

¿Aumentar head_max_len resuelve cualquier número de categorías?

Revisar respuesta comentada

No. Puede reducir el espacio del estado y aumentar el costo; aun así es necesario medir calidad, memoria y latencia con las nuevas configuraciones.

5

Modelo residente y alternancia de idioma

Qué es

El Router predeterminado mantiene pocos modelos calientes y puede descartar el menos reciente. Cuando dos lenguas alternan checkpoints y solo uno cabe en la política de caché, el costo de reconstrucción domina la llamada. Preload o max_loaded mayor resuelve el cambio, siempre que la memoria pueda con los modelos.

Por qué aprender

Las mediciones deben distinguir el camino caliente de la primera carga y de los cambios. La aplicación práctica evita la alternancia al mantener solo multilingual. El lock impide que dos solicitudes manipulen simultáneamente la carga y el runtime compartido.

Ejemplo aplicado

Una API que recrea Router en cada ticket pierde el beneficio de residencia. Cree una instancia por proceso.

Conceptos clave

LRU

descarte por uso

Hot path

modelo cargado

Cold start

primera carga

Lock

acceso serializado

Prueba tu comprensión

¿Más workers siempre aumentan la capacidad?

Revisar respuesta comentada

No. Cada proceso puede cargar su propia copia de los pesos. Mida memoria y throughput antes de aumentar el número de workers.

6

Batching y latencia percibida

Qué es

Laya agrupa las preguntas de un estado en una sola llamada. El laboratorio no implementa agregación de varios tickets de usuarios diferentes. La latencia vista en la interfaz incluye espera, HTTP, carga inicial e inferencia; runtime.inference_ms informa solo la etapa medida por el motor después de la preparación.

Por qué aprender

Comparar milisegundos sin declarar fronteras de medición genera conclusiones frágiles. Registre el número de preguntas y la distribución del largo de las entradas. Para operación, los percentiles altos y las fallas importan tanto como el promedio; una muestra pequeña no estima bien la cola.

Ejemplo aplicado

Cuatro preguntas en un ticket no son cuatro clientes atendidos. El throughput de preguntas y el throughput de tickets tienen denominadores diferentes.

Conceptos clave

Batch

lote de preguntas

p50

mediana

p95

cola de latencia

Throughput

unidades por segundo

Prueba tu comprensión

¿Es correcto dividir cualquier latencia entre cuatro y prometer ese tiempo por ticket?

Revisar respuesta comentada

No. Dividir puede estimar el costo promedio por pregunta en ese lote; el usuario espera la conclusión del ticket completo.

Resumen del módulo

Selecciona un fragmento de la lección para resaltarlo o anotarlo. Las dudas y notas quedan en tu recorrido; exporta el JSON para hacer respaldo.

Lectura del módulo