Especialización y proyecto final
Defina cuándo evolucionar y cuándo detenerse.
- Empieza por el error que importa
- Construye datos con separación clara
- El notebook de entrenamiento es una referencia
- RLCD y reglas de puntuación
- Operación gradual y reversible
- Entrega final: una decisión explicable por el proceso
Empieza por el error que importa
Qué es
El fine-tuning tiene costo y solo tiene sentido cuando los errores encontrados justifican cambiar el modelo. Algunos problemas vienen de categorías ambiguas, estado incompleto o un checkpoint inadecuado. Corregir esas causas puede ser más barato y más efectivo que entrenar una red nueva.
Por qué aprender
Clasifica errores antes de actuar: error de etiqueta humana, de esquema, de contexto, de idioma o de capacidad. Conserva ejemplos y condiciones de ejecución. Luego elige una intervención pequeña y vuelve a comparar, sin cambiar varias variables al mismo tiempo.
Si el estado no contiene el pedido final, ampliar el entrenamiento no recupera información ausente.
✓ Aplicar con criterio
Un contrato operativo ambiguo o información ausente. Primero define el resultado deseado y proporciona los hechos necesarios.
✗ Evitar la conclusión automática
¿Qué problema de triage no se resuelve solo con fine-tuning?
No aceptes una respuesta solo por el nombre del campo o por cómo se ve la precisión. Revisa la definición y el contexto de esta sección.
Conceptos clave
causa probable
cambio controlado
aprendizaje necesario
esfuerzo total
Prueba tu comprensión
¿Qué problema de triage no se resuelve solo con fine-tuning?
Revisar respuesta comentada
Un contrato operativo ambiguo o información ausente. Primero define el resultado deseado y proporciona los hechos necesarios.
Construye datos con separación clara
Qué es
Un dataset de dominio necesita representar lenguaje, frecuencia de clases y casos difíciles de la operación. Separa entrenamiento, calibración y prueba por grupos que eviten filtraciones, como conversación o cliente. Los mensajes casi duplicados en partes distintas pueden inflar resultados.
Por qué aprender
Registra la versión de la rúbrica y del proceso de etiquetado. Cuando la etiqueta venga de un modelo profesor, trátalo como una supervisión imperfecta. La concordancia con el profesor mide alineación con esa referencia, no una verdad universal ni calidad garantizada para clientes reales.
Una conversación con cinco mensajes debe permanecer en el mismo split, para que la prueba no revele solo fragmentos ya vistos.
-
1
Observa
Una conversación con cinco mensajes debe permanecer en el mismo split, para que la prueba no revele solo fragmentos ya vistos.
-
2
Define
Un dataset de dominio necesita representar lenguaje, frecuencia de clases y casos difíciles de la operación.
-
3
Revisa
Los mensajes de la misma conversación o los duplicados pueden aparecer en entrenamiento y prueba, haciendo la prueba artificialmente fácil.
Conceptos clave
partición
unidad de separación
fuente de etiquetas
información compartida
Prueba tu comprensión
¿Por qué dividir aleatoriamente cada mensaje puede ser inadecuado?
Revisar respuesta comentada
Los mensajes de la misma conversación o los duplicados pueden aparecer en entrenamiento y prueba, haciendo la prueba artificialmente fácil.
El notebook de entrenamiento es una referencia
Qué es
El repositorio incluye un notebook de fine-tuning para typed-decisions en dos GPUs T4. Prepara datos, entrena, ajusta temperaturas y evalúa. El tiempo publicado es una observación del autor para ese entorno y configuración, no una estimación garantizada para tu máquina o dataset.
Por qué aprender
Lee las celdas, los checkpoints de salida y el destino de publicación antes de ejecutar. El curso no ejecuta automáticamente este entrenamiento ni anuncia un modelo entrenado. El checkpoint usado en el laboratorio es el multilingüe proporcionado por el upstream.
El notebook está en notebooks/laya_finetune_typed_decisions_2xT4_kaggle.ipynb en el repositorio práctico.
Ejemplo de razonamiento
# Plan de experimento — no ejecuta entrenamiento.
1. Versionar rúbrica y ejemplos
2. Separar entrenamiento / calibración / prueba por conversación
3. Medir baseline y modelo actual
4. Ajustar solo en el conjunto permitido
5. Evaluar prueba reservada
6. Aprobar o rechazar la versión con criterios previos
Conceptos clave
ejecución por celdas
pasada por los datos
pesos nuevos
etapa separada
Prueba tu comprensión
¿Este curso entrega un fine-tuning ya hecho para tu negocio?
Revisar respuesta comentada
No. Entrega el runtime adaptado, la evaluación didáctica y el guion de evolución. Entrenar para un negocio exige datos y validación específicos.
RLCD y reglas de puntuación
Qué es
El trabajo usa recompensas basadas en distribuciones, incluyendo componentes logarítmico y esférico y un término ordinal para la puntuación. La idea es premiar probabilidades útiles, y no solo la etiqueta ganadora. La implementación concreta también tiene aproximaciones y detalles que deben leerse en el código.
Por qué aprender
Una función de entrenamiento con propiedades deseables no garantiza calibración después de un entrenamiento finito o un cambio de dominio. No presentes la matemática como sustituto de las pruebas. Las propias fichas de los modelos registran exceso de confianza y necesidad de ajustar temperaturas.
Aprender una distribución y evaluar su calidad son etapas distintas; el resultado empírico puede contradecir la expectativa teórica.
✓ Aplicar con criterio
No por sí sola. La capacidad, la optimización, la muestra y la distribución de uso influyen en el resultado; la calibración debe verificarse empíricamente.
✗ Evitar la conclusión automática
¿Elegir una regla propia garantiza que el 90% previsto sea 90% real?
No aceptes una respuesta solo por el nombre del campo o por cómo se ve la precisión. Revisa la definición y el contexto de esta sección.
Conceptos clave
incentivo probabilístico
señal de entrenamiento
distancia entre niveles
datos nuevos
Prueba tu comprensión
¿Elegir una regla propia garantiza que el 90% previsto sea 90% real?
Revisar respuesta comentada
No por sí sola. La capacidad, la optimización, la muestra y la distribución de uso influyen en el resultado; la calibración debe verificarse empíricamente.
Operación gradual y reversible
Qué es
Una evolución razonable empieza en modo sombra: el modelo recomienda, las personas deciden y las divergencias se analizan. Luego, una organización puede aprobar acciones simples y reversibles en un alcance estrecho, manteniendo registro y retorno a la cola manual. Esto es un plan de evolución, no una automatización ya implementada.
Por qué aprender
Define métricas y criterios de parada antes del piloto. Un aumento de errores en una categoría rara puede importar más que la estabilidad del promedio. Mantén versiones del esquema, el checkpoint y la política juntas para reproducir y deshacer cambios cuando sea necesario.
Si un producto nuevo cambia el sentido del cobro, la distribución puede cambiar. Reevalúa con datos recientes antes de mantener el mismo umbral.
Conceptos clave
sin acción
cambio de los datos
volver a una versión
límite definido
Prueba tu comprensión
¿Qué monitorear además de la precisión promedio?
Revisar respuesta comentada
Errores por clase, entradas rechazadas, indisponibilidad, latencia, cobertura de revisión y cambios en la distribución de los tickets.
Entrega final: una decisión explicable por el proceso
Qué es
Entrega el proyecto funcionando, el contrato de las cuatro preguntas, el dataset versionado, el informe de inferencia y el análisis de limitaciones. Explica por qué se eligió el checkpoint, cómo se valida la entrada y dónde permanece la responsabilidad humana. El proceso debe permitir entender la decisión incluso sin una justificación textual generada por el modelo.
Por qué aprender
Compara tres ejemplos: uno claro, uno ambiguo y uno fuera del dominio. Para cada uno, presenta la etiqueta esperada, la distribución recibida, la política y la conclusión humana. Esta entrega demuestra dominio de la arquitectura sin prometer una inteligencia universal ni ocultar fallas.
El evaluador debe poder instalar, repetir el comando, encontrar el resultado e identificar el siguiente experimento necesario.
Conceptos clave
repetir
encontrar el origen
frontera conocida
hipótesis
Prueba tu comprensión
¿Cuál es el criterio de conclusión del curso?
Revisar respuesta comentada
¿Puedes ejecutar pesos reales, interpretar choice/score/noul, evaluar una muestra, distinguir benchmark de promesa y diseñar una integración con permisos separados del modelo?
Resumen del módulo
- Un contrato operativo ambiguo o información ausente. Primero define el resultado deseado y proporciona los hechos necesarios.
- No. Entrega el runtime adaptado, la evaluación didáctica y el guion de evolución. Entrenar para un negocio exige datos y validación específicos.
- Errores por clase, entradas rechazadas, indisponibilidad, latencia, cobertura de revisión y cambios en la distribución de los tickets.
Selecciona un fragmento de la lección para resaltarlo o anotarlo. Las dudas y notas quedan en tu recorrido; exporta el JSON para hacer respaldo.