Las tres primitivas
Escribe preguntas que puedan evaluarse.
- Choice: una alternativa por pregunta
- Score: una escala ordinal
- Noul: la fuerza de una afirmación
- La confianza no es probabilidad de acierto
- El contrato JSON antes del modelo
- Ejercicio: formula y rotula
Choice: una alternativa por pregunta
Qué es
Choice retorna la alternativa con el mayor valor en la distribución y las probabilidades de las opciones. En este proyecto, billing cubre pagos, technical cubre problemas del producto, sales cubre nuevas compras y other recibe casos sin encaje. Las descripciones acompañan los nombres en el prompt interno del encoder.
Por qué aprender
Nombres cortos con descripciones claras ayudan a distinguir clases sin consumir todo el presupuesto de tokens. Si necesitas asignar varios rótulos independientes, una sola choice obligatoria no expresa el problema; considera preguntas binarias separadas y evalúa cada una.
Un mensaje sobre error de inicio de sesión corresponde a technical, mientras que una solicitud de segunda vía de la factura corresponde a billing.
✓ Aplicar con criterio
Usa dos preguntas noul independientes. Choice es adecuada para seleccionar un destino principal, no para representar todas las señales de un mensaje.
✗ Evitar la conclusión automática
¿Cómo clasificar simultáneamente reembolso y amenaza de cancelar?
No aceptes una respuesta solo por el nombre del campo o por cómo se ve la precisión. Revisa la definición y el contexto de esta sección.
Conceptos clave
mayor valor
conjunto de probabilidades
descripción de la clase
opción other
Prueba tu comprensión
¿Cómo clasificar simultáneamente reembolso y amenaza de cancelar?
Revisar respuesta comentada
Usa dos preguntas noul independientes. Choice es adecuada para seleccionar un destino principal, no para representar todas las señales de un mensaje.
Score: una escala ordinal
Qué es
Score usa una lista ordenada de niveles. El retorno es la expectativa de la distribución sobre los índices: con niveles 0, 1 y 2, puede aparecer 1,84. Eso no representa una clase nueva ni un plazo en horas. La leyenda debe explicar qué significa cada escalón para la operación.
Por qué aprender
Una escala solo tiene sentido cuando los niveles tienen orden y criterios distinguibles. Normal, sensible al tiempo y bloqueo inmediato son una rúbrica inicial. El upstream apunta score como una primitiva difícil; no conviertas una diferencia pequeña en el decimal en una decisión irreversible.
Con probabilidades 0,10; 0,30; 0,60, el score es 0×0,10 + 1×0,30 + 2×0,60 = 1,50.
-
1
Observa
Con probabilidades 0,10; 0,30; 0,60, el score es 0×0,10 + 1×0,30 + 2×0,60 = 1,50.
-
2
Define
Score usa una lista ordenada de niveles.
-
3
Revisa
No. Es un promedio que puede provenir de distribuciones diferentes. Consulta las probabilidades por nivel y el texto antes de definir la prioridad.
Conceptos clave
niveles ordenados
media ponderada
sentido de los niveles
error absoluto medio
Prueba tu comprensión
¿Un score de 1,5 prueba que el suceso es crítico?
Revisar respuesta comentada
No. Es un promedio que puede provenir de distribuciones diferentes. Consulta las probabilidades por nivel y el texto antes de definir la prioridad.
Noul: la fuerza de una afirmación
Qué es
Noul responde a una afirmación con un valor entre cero y uno. La pregunta debe ser observable en el estado: ¿el cliente pide dinero de vuelta? ¿El cliente amenaza con cancelar? La implementación usa opciones false y true y devuelve la probabilidad de true. No es una autorización para actuar.
Por qué aprender
Las preguntas sobre intención explícita son más fáciles de rotular que predicciones vagas sobre comportamiento futuro. Churn_risk en este laboratorio significa amenaza textual de cancelación; no fue entrenado ni validado aquí para predecir cancelaciones reales a lo largo de meses.
Quiero mi dinero de vuelta contiene un pedido explícito. Estoy insatisfecho no afirma necesariamente que la persona vaya a cancelar.
Ejemplo de razonamiento
"department": {
"type": "choice",
"instructions": "Which department handles this message?",
"criteria": {"billing": "payments and refunds",
"technical": "bugs and outages",
"sales": "new purchases",
"other": "unrelated or insufficient information"}
}
Conceptos clave
proposición
probabilidad modelada
frase observada
corte operativo
Prueba tu comprensión
El nombre churn_risk basta para convertir ese valor en una predicción comercial?
Revisar respuesta comentada
No. La definición de la pregunta restringe el significado: señal de amenaza explícita. Prever churn real exigiría otro conjunto de datos y validación longitudinal.
La confianza no es probabilidad de acierto
Qué es
En el SDK analizado, la confianza de choice y score es 1 menos la entropía normalizada de la distribución. Distribuciones concentradas producen valores altos; distribuciones dispersas producen valores bajos. Noul usa el mayor valor entre P(true) y P(false). Estos campos no comparten exactamente la misma definición.
Por qué aprender
No calcules ECE usando un campo llamado confidence sin verificar el código. Para evaluación de clasificación, el proyecto usa la probabilidad de la clase elegida. Incluso ese valor debe contrastarse con la frecuencia real de aciertos en datos separados.
Una distribución muy concentrada en la opción incorrecta tendrá alta confianza. Un checkpoint inadecuado para el idioma puede equivocarse así.
✓ Aplicar con criterio
No. Con la fórmula de entropía normalizada, la confianza es cero. La mayor probabilidad sigue siendo 0,5; son medidas diferentes.
✗ Evitar la conclusión automática
¿Dos clases con 0,5 cada una tienen una confianza choice de 0,5?
No aceptes una respuesta solo por el nombre del campo o por cómo se ve la precisión. Revisa la definición y el contexto de esta sección.
Conceptos clave
dispersión
mayor probabilidad
frecuencia versus predicción
certeza interna
Prueba tu comprensión
¿Dos clases con 0,5 cada una tienen una confianza choice de 0,5?
Revisar respuesta comentada
No. Con la fórmula de entropía normalizada, la confianza es cero. La mayor probabilidad sigue siendo 0,5; son medidas diferentes.
El contrato JSON antes del modelo
Qué es
El esquema contiene identificadores estables, type, instructions y criteria cuando es necesario. Choice usa un diccionario; score usa una lista ordenada; noul puede usar una afirmación sin criterios extra. Mantener identificadores estables preserva a los consumidores de la API cuando mejora la redacción.
Por qué aprender
Valida los resultados antes de la política: las clases deben conocerse, los valores deben ser finitos y las probabilidades deben sumar aproximadamente uno. El redondeo del SDK exige una tolerancia pequeña. Las entradas inválidas deben generar un error visible, no una respuesta que parezca haber sido calculada.
Una respuesta con NaN, departamento desconocido o distribución incompleta se rechaza por la adaptación.
Conceptos clave
formato estable
verificación de datos
redondeo
código que lee la salida
Prueba tu comprensión
¿Por qué no aceptar silenciosamente una nueva categoría?
Revisar respuesta comentada
Puede no tener destino definido. Es necesario actualizar esquema, política, interfaz y pruebas juntos antes de usar la nueva categoría.
Ejercicio: formula y rotula
Qué es
Escribe seis mensajes de atención y responde manualmente las cuatro preguntas. Incluye cobro, falla técnica, nueva compra, conversación irrelevante, cancelación explícita e insatisfacción sin cancelación. Pídele a la otra persona que aplique la misma rúbrica sin ver sus respuestas.
Por qué aprender
Las discrepancias entre humanos muestran dónde la pregunta o la rúbrica necesita mejorar. No uses el modelo para decidir automáticamente qué humano tiene la razón. Registra la regla adoptada y conserva algunos ejemplos que no se usarán durante el ajuste de las preguntas.
Caso ambiguo: el sistema se cayó y quiero reembolso. El destino principal depende de la regla; la señal refund_requested puede ser positiva independientemente de eso.
Conceptos clave
respuesta humana
múltiples lecturas
acuerdo documentado
ejemplos no ajustados
Prueba tu comprensión
¿Qué debe acompañar a cada ejemplo rotulado?
Revisar respuesta comentada
Un identificador, el mensaje, el rótulo esperado y, en un dataset propio, la justificación y la versión de la rúbrica. Elimina datos personales innecesarios.
Resumen del módulo
- Usa dos preguntas noul independientes. Choice es adecuada para seleccionar un destino principal, no para representar todas las señales de un mensaje.
- No. La definición de la pregunta restringe el significado: señal de amenaza explícita. Prever churn real exigiría otro conjunto de datos y validación longitudinal.
- Puede no tener destino definido. Es necesario actualizar esquema, política, interfaz y pruebas juntos antes de usar la nueva categoría.
Selecciona un fragmento de la lección para resaltarlo o anotarlo. Las dudas y notas quedan en tu recorrido; exporta el JSON para hacer respaldo.