Tu comodidad de lectura
TRILHA 4

📊 Calidad y evolución

Mide errores, calibra expectativas y planea la especialización.

2 módulos 12 temas 70–100 min con práctica 12 ejercicios
Comprender Experimentar Verificar LAYA / INEMA · flujo conceptual
Tu progreso

Mapa de la ruta

4.1 35–50 min

📊 Benchmarks, calibración y evaluación

Compare lo que realmente se midió.

4.2 35–50 min

📊 Especialización y proyecto final

Defina cuándo evolucionar y cuándo detenerse.

Contenido detallado

MÓDULO 4.1

Benchmarks, calibración y evaluación

Compare lo que realmente se midió.

Qué es

Las fuentes combinan resultados de benchmarks, tareas y checkpoints diferentes.

Por qué aprender

Antes de repetir un porcentaje, anote el modelo, la revisión, el dataset, la cantidad de clases, el número de ejemplos y el método.

Conceptos clave

Protocolo

condiciones

Muestra

ejemplos usados

Tarea

objetivo medido

Comparabilidad

condiciones alineadas

Qué es

El informe actual muestra los checkpoints base por debajo de la baseline de la clase mayoritaria en typed-decisions, mientras que la versión especializada mejora.

Por qué aprender

En el laboratorio, el conjunto pequeño de tickets es un smoke test funcional.

Conceptos clave

Zero-shot

tarea sin ajuste

Baseline

referencia simple

Especialista

modelo ajustado

Generalización

datos nuevos

Qué es

La precisión es la fracción de predicciones correctas.

Por qué aprender

En atención, confundir sales con other puede tener un impacto distinto a desviar un incidente crítico.

Conceptos clave

Precisión

fracción correcta

Confusión

error entre clases

Desbalanceo

clases desiguales

Baseline de la mayoritaria

clase dominante

Qué es

El Brier multiclasses suma el error cuadrático entre probabilidades y etiqueta one-hot.

Por qué aprender

Declare la fórmula: algunos informes dividen Brier por la cantidad de clases, otros suman.

Conceptos clave

Brier

error de la distribución

ECE

diferencia por rangos

One-hot

etiqueta unitaria

Bin

intervalo de probabilidad

Qué es

La temperature scaling divide los logits por una temperatura antes del softmax.

Por qué aprender

El checkpoint multilingüe se describe como no calibrado para el dominio del usuario.

Conceptos clave

Temperatura

escala de logits

Holdout

datos reservados

Cobertura

fracción aceptada

Fuga

uso indebido de la prueba

Qué es

El comando evaluate lee JSONL, ejecuta pesos reales y guarda resultados por ejemplo, exactitud, baseline, Brier y ECE.

Por qué aprender

Usa el informe como punto de partida para un conjunto propio.

Conceptos clave

JSONL

un caso por línea

Evidencia

resultados por caso

Error

oportunidad de diagnóstico

Nuevo test

datos no vistos

Ver completo →
MÓDULO 4.2

Especialización y proyecto final

Defina cuándo evolucionar y cuándo detenerse.

Qué es

El fine-tuning tiene costo y solo tiene sentido cuando los errores encontrados justifican cambiar el modelo.

Por qué aprender

Clasifica los errores antes de actuar: error de etiqueta humana, de esquema, de contexto, de idioma o de capacidad.

Conceptos clave

Diagnóstico

causa probable

Intervención

cambio controlado

Capacidad

aprendizaje necesario

Costo

esfuerzo total

Qué es

Un dataset de dominio necesita representar lenguaje, frecuencia de clases y casos difíciles de la operación.

Por qué aprender

Registra la versión de la rúbrica y el proceso de etiquetado.

Conceptos clave

Split

partición

Grupo

unidad de separación

Profesor

fuente de etiquetas

Fuga

información compartida

Qué es

El repositorio incluye un cuaderno de fine-tuning para typed-decisions en dos GPUs T4.

Por qué aprender

Lee las celdas, los checkpoints de salida y el destino de publicación antes de ejecutar.

Conceptos clave

Notebook

ejecución por celdas

Época

pasada por los datos

Checkpoint de salida

pesos nuevos

Publicación

etapa separada

Qué es

El trabajo usa recompensas basadas en distribuciones, incluyendo componentes logarítmico y esférico, y un término ordinal para el score.

Por qué aprender

Una función de entrenamiento con propiedades deseables no garantiza calibración después de un entrenamiento finito o un cambio de dominio.

Conceptos clave

Regla propia

incentivo probabilístico

Recompensa

señal de entrenamiento

Ordinalidad

distancia entre niveles

Cambio de dominio

datos nuevos

Qué es

Una evolución razonable empieza en modo sombra: el modelo recomienda, humanos deciden y las divergencias se analizan.

Por qué aprender

Define métricas y criterios de parada antes del piloto.

Conceptos clave

Modo sombra

sin acción

Drift

cambio de los datos

Rollback

volver a una versión

Criterio de parada

límite definido

Qué es

Entrega el proyecto funcionando, contrato de las cuatro preguntas, dataset versionado, informe de inferencia y análisis de limitaciones.

Por qué aprender

Compara tres ejemplos: uno claro, uno ambiguo y uno fuera del dominio.

Conceptos clave

Reproducibilidad

repetir

Trazabilidad

encontrar el origen

Limitación

frontera conocida

Próximo experimento

hipótesis

Ver completo →
Lectura del módulo