📊 Calidad y evolución
Mide errores, calibra expectativas y planea la especialización.
Mapa de la ruta
📊 Benchmarks, calibración y evaluación
Compare lo que realmente se midió.
📊 Especialización y proyecto final
Defina cuándo evolucionar y cuándo detenerse.
Contenido detallado
Benchmarks, calibración y evaluación
Compare lo que realmente se midió.
Qué es
Las fuentes combinan resultados de benchmarks, tareas y checkpoints diferentes.
Por qué aprender
Antes de repetir un porcentaje, anote el modelo, la revisión, el dataset, la cantidad de clases, el número de ejemplos y el método.
Conceptos clave
condiciones
ejemplos usados
objetivo medido
condiciones alineadas
Qué es
El informe actual muestra los checkpoints base por debajo de la baseline de la clase mayoritaria en typed-decisions, mientras que la versión especializada mejora.
Por qué aprender
En el laboratorio, el conjunto pequeño de tickets es un smoke test funcional.
Conceptos clave
tarea sin ajuste
referencia simple
modelo ajustado
datos nuevos
Qué es
La precisión es la fracción de predicciones correctas.
Por qué aprender
En atención, confundir sales con other puede tener un impacto distinto a desviar un incidente crítico.
Conceptos clave
fracción correcta
error entre clases
clases desiguales
clase dominante
Qué es
El Brier multiclasses suma el error cuadrático entre probabilidades y etiqueta one-hot.
Por qué aprender
Declare la fórmula: algunos informes dividen Brier por la cantidad de clases, otros suman.
Conceptos clave
error de la distribución
diferencia por rangos
etiqueta unitaria
intervalo de probabilidad
Qué es
La temperature scaling divide los logits por una temperatura antes del softmax.
Por qué aprender
El checkpoint multilingüe se describe como no calibrado para el dominio del usuario.
Conceptos clave
escala de logits
datos reservados
fracción aceptada
uso indebido de la prueba
Qué es
El comando evaluate lee JSONL, ejecuta pesos reales y guarda resultados por ejemplo, exactitud, baseline, Brier y ECE.
Por qué aprender
Usa el informe como punto de partida para un conjunto propio.
Conceptos clave
un caso por línea
resultados por caso
oportunidad de diagnóstico
datos no vistos
Especialización y proyecto final
Defina cuándo evolucionar y cuándo detenerse.
Qué es
El fine-tuning tiene costo y solo tiene sentido cuando los errores encontrados justifican cambiar el modelo.
Por qué aprender
Clasifica los errores antes de actuar: error de etiqueta humana, de esquema, de contexto, de idioma o de capacidad.
Conceptos clave
causa probable
cambio controlado
aprendizaje necesario
esfuerzo total
Qué es
Un dataset de dominio necesita representar lenguaje, frecuencia de clases y casos difíciles de la operación.
Por qué aprender
Registra la versión de la rúbrica y el proceso de etiquetado.
Conceptos clave
partición
unidad de separación
fuente de etiquetas
información compartida
Qué es
El repositorio incluye un cuaderno de fine-tuning para typed-decisions en dos GPUs T4.
Por qué aprender
Lee las celdas, los checkpoints de salida y el destino de publicación antes de ejecutar.
Conceptos clave
ejecución por celdas
pasada por los datos
pesos nuevos
etapa separada
Qué es
El trabajo usa recompensas basadas en distribuciones, incluyendo componentes logarítmico y esférico, y un término ordinal para el score.
Por qué aprender
Una función de entrenamiento con propiedades deseables no garantiza calibración después de un entrenamiento finito o un cambio de dominio.
Conceptos clave
incentivo probabilístico
señal de entrenamiento
distancia entre niveles
datos nuevos
Qué es
Una evolución razonable empieza en modo sombra: el modelo recomienda, humanos deciden y las divergencias se analizan.
Por qué aprender
Define métricas y criterios de parada antes del piloto.
Conceptos clave
sin acción
cambio de los datos
volver a una versión
límite definido
Qué es
Entrega el proyecto funcionando, contrato de las cuatro preguntas, dataset versionado, informe de inferencia y análisis de limitaciones.
Por qué aprender
Compara tres ejemplos: uno claro, uno ambiguo y uno fuera del dominio.
Conceptos clave
repetir
encontrar el origen
frontera conocida
hipótesis