Tu comodidad de lectura
MÓDULO 4.1

Benchmarks, calibración y evaluación

Compare lo que realmente se midió.

6 tópicos 35–50 min con práctica Calidad y evolución Ejercicios comentados
Datos etiquetados Métricas Conclusión LAYA / INEMA · flujo conceptual
Tu progreso
Tu progreso
  1. Lee la unidad de comparación
  2. Los límites del zero-shot
  3. Precisión y matriz de confusión
  4. Brier y ECE responden preguntas diferentes
  5. La calibración exige datos reservados
  6. Ejecuta e interpreta la evaluación local
1

Lee la unidad de comparación

Qué es

Las fuentes combinan resultados de benchmarks, tareas y checkpoints diferentes. El rendimiento del modelo especializado no describe el modelo base. Los números de Jev citados por Laya provienen de terceros y no de una ejecución controlada por el mismo autor con prompts idénticos.

Por qué aprender

Antes de repetir un porcentaje, anota modelo, revisión, dataset, cantidad de clases, número de ejemplos y método. Una tabla puede ser útil como indicación de investigación sin sustentar un ranking universal. Las condiciones deben acompañar a los números en el informe.

Ejemplo aplicado

Typed-decisions usa workflows específicos; Banking77 prueba muchas clases. Ganar en el primero no implica ganar en el segundo.

✓ Aplicar con criterio

No sin reservas. El espacio de respuestas y la muestra cambian la dificultad; registra la diferencia y evita atribuirlo todo a la arquitectura.

✗ Evitar la conclusión automática

¿Puedo comparar 72 clases con 77 como si fuera la misma prueba?

No aceptes una respuesta solo por el nombre del campo o por cómo se ve la precisión. Revisa la definición y el contexto de esta sección.

Conceptos clave

Protocolo

condiciones

Muestra

ejemplos usados

Tarea

objetivo medido

Comparabilidad

condiciones alineadas

Prueba tu comprensión

¿Puedo comparar 72 clases con 77 como si fuera la misma prueba?

Revisar respuesta comentada

No sin reservas. El espacio de respuestas y la muestra cambian la dificultad; registra la diferencia y evita atribuirlo todo a la arquitectura.

2

Los límites del zero-shot

Qué es

El informe actual muestra los checkpoints base por debajo de la baseline de la clase mayoritaria en typed-decisions, mientras que la versión especializada mejora. Esto indica que indicar preguntas nuevas no garantiza competencia en el dominio. La especialización y los datos de entrenamiento importan para interpretar el resultado.

Por qué aprender

En el laboratorio, el conjunto pequeño de tickets es una prueba funcional de smoke test. Incluso un resultado excelente no valida mensajes reales, abreviaciones, casos adversarios ni categorías raras. El siguiente paso es reunir ejemplos representativos antes de decidir invertir en entrenamiento.

Ejemplo aplicado

Un modelo entrenado para cuatro workflows sintéticos no se convierte automáticamente en un analista universal de procesos empresariales.

  1. 1
    Observa

    Un modelo entrenado para cuatro workflows sintéticos no se convierte automáticamente en un analista universal de procesos empresariales.

  2. 2
    Define

    El informe actual muestra los checkpoints base por debajo de la baseline de la clase mayoritaria en typed-decisions, mientras que la versión especializada mejora.

  3. 3
    Revisa

    No. La ficha informa el alcance específico y recomienda validación propia; el rendimiento fuera de esos workflows puede caer.

Conceptos clave

Zero-shot

tarea sin ajuste

Baseline

referencia simple

Especialista

modelo ajustado

Generalización

datos nuevos

Prueba tu comprensión

¿Que el modelo especializado tenga buena precisión dispensa probar en otro dominio?

Revisar respuesta comentada

No. La ficha informa el alcance específico y recomienda validación propia; el rendimiento fuera de esos workflows puede caer.

3

Precisión y matriz de confusión

Qué es

La precisión es la fracción de predicciones correctas. Puede ocultar desbalance y errores concentrados en una clase. Una matriz de confusión cuenta, para cada etiqueta esperada, qué salidas se produjeron. Compara también una regla simple, como siempre elegir la clase más frecuente.

Por qué aprender

En atención, confundir sales con other puede tener un impacto distinto a desviar un incidente crítico. Reporta errores por categoría y ejemplos representativos. Con una muestra pequeña, muestra conteos además de porcentajes para no sugerir precisión estadística que los datos no sostienen.

Ejemplo aplicado

Si 90 de 100 tickets son financieros, elegir billing siempre ya da 90% de precisión, sin entender ningún texto.

Ejemplo de razonamiento

python3 -m practical --device cuda evaluate --output avaliacao.json
# Muestra local: 16 tickets sintéticos, 4 departamentos
# 13/16 aciertos; baseline mayoritaria = 4/16
# Resultado didáctico, no validación de producción.

Conceptos clave

Precisión

fracción correcta

Confusión

error entre clases

Desbalanceo

clases desiguales

Baseline de la mayoritaria

clase dominante

Prueba tu comprensión

¿Por qué el dataset didáctico incluye cuatro clases en igual cantidad?

Revisar respuesta comentada

Para que el smoke test sea fácil de inspeccionar y la baseline sea explícita. Esto no reproduce necesariamente la frecuencia real de una operación.

4

Brier y ECE responden preguntas diferentes

Qué es

El Brier multiclase suma el error cuadrático entre probabilidades y la etiqueta one-hot. ECE compara, en rangos de probabilidad, la confianza media y la frecuencia de acierto. La implementación usa la probabilidad de la clase elegida en diez bins, no la confianza de entropía del SDK.

Por qué aprender

Declara la fórmula: algunos informes dividen Brier entre el número de clases, otros lo suman. ECE depende de los rangos y de la muestra; pocos casos dejan bins vacíos o inestables. Un valor pequeño en dieciséis ejemplos no es una prueba de calibración.

Ejemplo aplicado

Una predicción errada con probabilidad 0,99 recibe una penalización mayor que una distribución cautelosa. Las dos pueden tener la misma precisión de argmax.

✓ Aplicar con criterio

Las normalizaciones, clases y conjuntos pueden diferir. Incluso el mismo nombre de métrica no garantiza una definición idéntica.

✗ Evitar la conclusión automática

¿Por qué no comparar Brier de dos informes sin leer el método?

No aceptes una respuesta solo por el nombre del campo o por cómo se ve la precisión. Revisa la definición y el contexto de esta sección.

Conceptos clave

Brier

error de la distribución

ECE

diferencia por rangos

One-hot

etiqueta unitaria

Bin

intervalo de probabilidad

Prueba tu comprensión

¿Por qué no comparar Brier de dos informes sin leer el método?

Revisar respuesta comentada

Las normalizaciones, clases y conjuntos pueden diferir. Incluso el mismo nombre de métrica no garantiza una definición idéntica.

5

La calibración exige datos reservados

Qué es

La temperature scaling divide logits por una temperatura antes del softmax. Puede reducir el exceso de confianza sin mejorar la clasificación elegida. Ajustar la temperatura y medir su efecto en los mismos datos crea una estimación optimista. Separa la calibración de la evaluación final.

Por qué aprender

El checkpoint multilingüe se describe como no calibrado para el dominio del usuario. El laboratorio informa esta condición y no finge realizar calibración. Antes de confiar en un umbral, reúne datos suficientes y observa la tasa de error versus cobertura en el conjunto reservado.

Ejemplo aplicado

El entrenamiento enseña parámetros; la calibración ajusta probabilidades; la prueba mide el resultado final sin nuevos ajustes.

Conceptos clave

Temperatura

escala de logits

Holdout

datos reservados

Cobertura

fracción aceptada

Fuga

uso indebido de la prueba

Prueba tu comprensión

¿Ajustar la temperatura puede corregir el departamento equivocado en todos los casos?

Revisar respuesta comentada

No. Una temperatura positiva global preserva el orden de los logits. Cambia la distribución, no la capacidad de distinguir clases.

6

Ejecuta e interpreta la evaluación local

Qué es

El comando evaluate lee JSONL, ejecuta pesos reales y guarda resultados por ejemplo, precisión, baseline, Brier y ECE. Los mensajes son sintéticos y el informe incluye una limitación explícita. Inspecciona cada error antes de pensar en entrenamiento o en cambiar un umbral.

Por qué aprender

Usa el informe como punto de partida para un conjunto propio. Agrega negaciones, duplicados, mensajes muy cortos, categorías raras y textos largos. Si cambias preguntas después de ver los resultados, mantén la versión anterior y evalúa en nuevos casos reservados.

Ejemplo aplicado

python3 -m practical --device cuda evaluate --output avaliacao.json

Conceptos clave

JSONL

un caso por línea

Evidencia

resultados por caso

Error

oportunidad de diagnóstico

Nuevo test

datos no vistos

Prueba tu comprensión

¿Qué conclusión está permitida si todos los ejemplos didácticos salen bien?

Revisar respuesta comentada

Que el camino de inferencia clasificó correctamente esa muestra, en ese entorno y con ese esquema. No que la herramienta esté validada para producción.

Resumen del módulo

Selecciona un fragmento de la lección para resaltarlo o anotarlo. Las dudas y notas quedan en tu recorrido; exporta el JSON para hacer respaldo.

Lectura del módulo