Benchmarks, calibración y evaluación
Compare lo que realmente se midió.
- Lee la unidad de comparación
- Los límites del zero-shot
- Precisión y matriz de confusión
- Brier y ECE responden preguntas diferentes
- La calibración exige datos reservados
- Ejecuta e interpreta la evaluación local
Lee la unidad de comparación
Qué es
Las fuentes combinan resultados de benchmarks, tareas y checkpoints diferentes. El rendimiento del modelo especializado no describe el modelo base. Los números de Jev citados por Laya provienen de terceros y no de una ejecución controlada por el mismo autor con prompts idénticos.
Por qué aprender
Antes de repetir un porcentaje, anota modelo, revisión, dataset, cantidad de clases, número de ejemplos y método. Una tabla puede ser útil como indicación de investigación sin sustentar un ranking universal. Las condiciones deben acompañar a los números en el informe.
Typed-decisions usa workflows específicos; Banking77 prueba muchas clases. Ganar en el primero no implica ganar en el segundo.
✓ Aplicar con criterio
No sin reservas. El espacio de respuestas y la muestra cambian la dificultad; registra la diferencia y evita atribuirlo todo a la arquitectura.
✗ Evitar la conclusión automática
¿Puedo comparar 72 clases con 77 como si fuera la misma prueba?
No aceptes una respuesta solo por el nombre del campo o por cómo se ve la precisión. Revisa la definición y el contexto de esta sección.
Conceptos clave
condiciones
ejemplos usados
objetivo medido
condiciones alineadas
Prueba tu comprensión
¿Puedo comparar 72 clases con 77 como si fuera la misma prueba?
Revisar respuesta comentada
No sin reservas. El espacio de respuestas y la muestra cambian la dificultad; registra la diferencia y evita atribuirlo todo a la arquitectura.
Los límites del zero-shot
Qué es
El informe actual muestra los checkpoints base por debajo de la baseline de la clase mayoritaria en typed-decisions, mientras que la versión especializada mejora. Esto indica que indicar preguntas nuevas no garantiza competencia en el dominio. La especialización y los datos de entrenamiento importan para interpretar el resultado.
Por qué aprender
En el laboratorio, el conjunto pequeño de tickets es una prueba funcional de smoke test. Incluso un resultado excelente no valida mensajes reales, abreviaciones, casos adversarios ni categorías raras. El siguiente paso es reunir ejemplos representativos antes de decidir invertir en entrenamiento.
Un modelo entrenado para cuatro workflows sintéticos no se convierte automáticamente en un analista universal de procesos empresariales.
-
1
Observa
Un modelo entrenado para cuatro workflows sintéticos no se convierte automáticamente en un analista universal de procesos empresariales.
-
2
Define
El informe actual muestra los checkpoints base por debajo de la baseline de la clase mayoritaria en typed-decisions, mientras que la versión especializada mejora.
-
3
Revisa
No. La ficha informa el alcance específico y recomienda validación propia; el rendimiento fuera de esos workflows puede caer.
Conceptos clave
tarea sin ajuste
referencia simple
modelo ajustado
datos nuevos
Prueba tu comprensión
¿Que el modelo especializado tenga buena precisión dispensa probar en otro dominio?
Revisar respuesta comentada
No. La ficha informa el alcance específico y recomienda validación propia; el rendimiento fuera de esos workflows puede caer.
Precisión y matriz de confusión
Qué es
La precisión es la fracción de predicciones correctas. Puede ocultar desbalance y errores concentrados en una clase. Una matriz de confusión cuenta, para cada etiqueta esperada, qué salidas se produjeron. Compara también una regla simple, como siempre elegir la clase más frecuente.
Por qué aprender
En atención, confundir sales con other puede tener un impacto distinto a desviar un incidente crítico. Reporta errores por categoría y ejemplos representativos. Con una muestra pequeña, muestra conteos además de porcentajes para no sugerir precisión estadística que los datos no sostienen.
Si 90 de 100 tickets son financieros, elegir billing siempre ya da 90% de precisión, sin entender ningún texto.
Ejemplo de razonamiento
python3 -m practical --device cuda evaluate --output avaliacao.json
# Muestra local: 16 tickets sintéticos, 4 departamentos
# 13/16 aciertos; baseline mayoritaria = 4/16
# Resultado didáctico, no validación de producción.
Conceptos clave
fracción correcta
error entre clases
clases desiguales
clase dominante
Prueba tu comprensión
¿Por qué el dataset didáctico incluye cuatro clases en igual cantidad?
Revisar respuesta comentada
Para que el smoke test sea fácil de inspeccionar y la baseline sea explícita. Esto no reproduce necesariamente la frecuencia real de una operación.
Brier y ECE responden preguntas diferentes
Qué es
El Brier multiclase suma el error cuadrático entre probabilidades y la etiqueta one-hot. ECE compara, en rangos de probabilidad, la confianza media y la frecuencia de acierto. La implementación usa la probabilidad de la clase elegida en diez bins, no la confianza de entropía del SDK.
Por qué aprender
Declara la fórmula: algunos informes dividen Brier entre el número de clases, otros lo suman. ECE depende de los rangos y de la muestra; pocos casos dejan bins vacíos o inestables. Un valor pequeño en dieciséis ejemplos no es una prueba de calibración.
Una predicción errada con probabilidad 0,99 recibe una penalización mayor que una distribución cautelosa. Las dos pueden tener la misma precisión de argmax.
✓ Aplicar con criterio
Las normalizaciones, clases y conjuntos pueden diferir. Incluso el mismo nombre de métrica no garantiza una definición idéntica.
✗ Evitar la conclusión automática
¿Por qué no comparar Brier de dos informes sin leer el método?
No aceptes una respuesta solo por el nombre del campo o por cómo se ve la precisión. Revisa la definición y el contexto de esta sección.
Conceptos clave
error de la distribución
diferencia por rangos
etiqueta unitaria
intervalo de probabilidad
Prueba tu comprensión
¿Por qué no comparar Brier de dos informes sin leer el método?
Revisar respuesta comentada
Las normalizaciones, clases y conjuntos pueden diferir. Incluso el mismo nombre de métrica no garantiza una definición idéntica.
La calibración exige datos reservados
Qué es
La temperature scaling divide logits por una temperatura antes del softmax. Puede reducir el exceso de confianza sin mejorar la clasificación elegida. Ajustar la temperatura y medir su efecto en los mismos datos crea una estimación optimista. Separa la calibración de la evaluación final.
Por qué aprender
El checkpoint multilingüe se describe como no calibrado para el dominio del usuario. El laboratorio informa esta condición y no finge realizar calibración. Antes de confiar en un umbral, reúne datos suficientes y observa la tasa de error versus cobertura en el conjunto reservado.
El entrenamiento enseña parámetros; la calibración ajusta probabilidades; la prueba mide el resultado final sin nuevos ajustes.
Conceptos clave
escala de logits
datos reservados
fracción aceptada
uso indebido de la prueba
Prueba tu comprensión
¿Ajustar la temperatura puede corregir el departamento equivocado en todos los casos?
Revisar respuesta comentada
No. Una temperatura positiva global preserva el orden de los logits. Cambia la distribución, no la capacidad de distinguir clases.
Ejecuta e interpreta la evaluación local
Qué es
El comando evaluate lee JSONL, ejecuta pesos reales y guarda resultados por ejemplo, precisión, baseline, Brier y ECE. Los mensajes son sintéticos y el informe incluye una limitación explícita. Inspecciona cada error antes de pensar en entrenamiento o en cambiar un umbral.
Por qué aprender
Usa el informe como punto de partida para un conjunto propio. Agrega negaciones, duplicados, mensajes muy cortos, categorías raras y textos largos. Si cambias preguntas después de ver los resultados, mantén la versión anterior y evalúa en nuevos casos reservados.
python3 -m practical --device cuda evaluate --output avaliacao.json
Conceptos clave
un caso por línea
resultados por caso
oportunidad de diagnóstico
datos no vistos
Prueba tu comprensión
¿Qué conclusión está permitida si todos los ejemplos didácticos salen bien?
Revisar respuesta comentada
Que el camino de inferencia clasificó correctamente esa muestra, en ese entorno y con ese esquema. No que la herramienta esté validada para producción.
Resumen del módulo
- No sin reservas. El espacio de respuestas y la muestra cambian la dificultad; registra la diferencia y evita atribuirlo todo a la arquitectura.
- Para que el smoke test sea fácil de inspeccionar y la baseline sea explícita. Esto no reproduce necesariamente la frecuencia real de una operación.
- No. Una temperatura positiva global preserva el orden de los logits. Cambia la distribución, no la capacidad de distinguir clases.
Selecciona un fragmento de la lección para resaltarlo o anotarlo. Las dudas y notas quedan en tu recorrido; exporta el JSON para hacer respaldo.